PostgresML + LlamaIndex: реранкинг поднимает recall векторного поиска до 95%
Простым языком
Векторный поиск быстрый, но неточный — он ищет по сходству эмбеддингов, а не по смыслу. Реранкинг берет короткий список кандидатов от быстрого поиска и пересортировывает его с помощью умной модели, которая понимает смысл запроса. Результат: вы получаете и скорость, и точность.
Что нового
- Двухэтапный пайплайн: быстрый ANN-поиск → точный cross-encoder реранкинг.
- Вызов модели реранкера внутри PostgreSQL через PostgresML (pgml.transform) — без внешнего ML-сервиса.
- LlamaIndex оркестрирует процесс: эмбеддинги → ANN → передача кандидатов в PostgresML.
Вердикт
Применять, если у вас PostgreSQL и нужно поднять качество retrieval без миграции на микросервисы. Не подходит для real-time систем с SLA <50 мс или если нужен реранкер сложнее MiniLM.
Двухэтапный поиск (ANN → cross-encoder реранкинг) поднимает recall с 0.62 до 0.95 при росте latency всего на 40 мс; PostgresML позволяет вызывать реранкер прямо в SQL через pgml.transform().