Яндекс: как построить AI Chat для интранета на базе поиска и снизить галлюцинации
Команда Яндекс Infrastructure описала архитектуру внутреннего AI-чата для корпоративного интранета. Система построена на базе существующего поиска, а для снижения галлюцинаций используется гибридное ранжирование и фича-инжиниринг контекста. Внедрение подтверждено A/B-тестами.
Что
В Яндекс Infrastructure разработали и внедрили генеративную Q&A-систему AI Chat для внутреннего поиска по корпоративному интранету. Система построена на базе существующего поискового движка и предназначена для ответов на вопросы сотрудников с использованием внутренней документации.
Как
Архитектура строится на принципе «поиск как база для генеративки». Вместо того чтобы подавать в LLM сырой текст, используется поисковый контекст, отфильтрованный и ранжированный существующей поисковой системой. Ключевые инженерные решения:
- Гибридное ранжирование: комбинация классических (BM25) и нейросетевых (dense) методов для точного извлечения релевантных документов.
- Фича-инжиниринг контекста: преобразование поисковых фич (например, позиция документа в выдаче, релевантность) в признаки для генеративной модели. Это позволяет модели «доверять» информации из более релевантных источников.
- Построение Q&A-пайплайна: система не просто генерирует ответ, а сначала находит документы, затем извлекает из них фрагменты и только потом генерирует ответ на основе этого структурированного контекста.
Цифры
В статье приводятся результаты реальных A/B-экспериментов, подтверждающих эффективность подхода. Хотя конкретные абсолютные цифры (например, точность ответов) требуют изучения полного текста статьи, автор подчеркивает, что метрики демонстрируют снижение галлюцинаций и повышение полезности ответов по сравнению с прямой генерацией LLM без поискового контекста. Подход «поиск → генерация» показал себя эффективнее, чем попытки тюнинга промптов и температуры модели.
Что перенять
Паттерн «Search-Augmented Generation» для корпоративных знаний. Вместо создания генеративной системы с нуля, используйте существующую поисковую инфраструктуру как фильтр и ранжировщик контекста для LLM. Это снижает галлюцинации, так как модель отвечает на основе проверенных внутренних документов, а не на общих знаниях. Фичи поиска (релевантность, позиция) становятся фичами генерации, повышая предсказуемость системы.
Для снижения галлюцинаций в корпоративном Q&A используйте существующий поиск как фильтр и ранжировщик контекста для LLM, а не подавайте модели сырой текст.