🎯 Проекты 2 мин чтения

Яндекс: как построить AI Chat для интранета на базе поиска и снизить галлюцинации

Команда Яндекс Infrastructure описала архитектуру внутреннего AI-чата для корпоративного интранета. Система построена на базе существующего поиска, а для снижения галлюцинаций используется гибридное ранжирование и фича-инжиниринг контекста. Внедрение подтверждено A/B-тестами.

Что

В Яндекс Infrastructure разработали и внедрили генеративную Q&A-систему AI Chat для внутреннего поиска по корпоративному интранету. Система построена на базе существующего поискового движка и предназначена для ответов на вопросы сотрудников с использованием внутренней документации.

Как

Архитектура строится на принципе «поиск как база для генеративки». Вместо того чтобы подавать в LLM сырой текст, используется поисковый контекст, отфильтрованный и ранжированный существующей поисковой системой. Ключевые инженерные решения:

  • Гибридное ранжирование: комбинация классических (BM25) и нейросетевых (dense) методов для точного извлечения релевантных документов.
  • Фича-инжиниринг контекста: преобразование поисковых фич (например, позиция документа в выдаче, релевантность) в признаки для генеративной модели. Это позволяет модели «доверять» информации из более релевантных источников.
  • Построение Q&A-пайплайна: система не просто генерирует ответ, а сначала находит документы, затем извлекает из них фрагменты и только потом генерирует ответ на основе этого структурированного контекста.

Цифры

В статье приводятся результаты реальных A/B-экспериментов, подтверждающих эффективность подхода. Хотя конкретные абсолютные цифры (например, точность ответов) требуют изучения полного текста статьи, автор подчеркивает, что метрики демонстрируют снижение галлюцинаций и повышение полезности ответов по сравнению с прямой генерацией LLM без поискового контекста. Подход «поиск → генерация» показал себя эффективнее, чем попытки тюнинга промптов и температуры модели.

Что перенять

Паттерн «Search-Augmented Generation» для корпоративных знаний. Вместо создания генеративной системы с нуля, используйте существующую поисковую инфраструктуру как фильтр и ранжировщик контекста для LLM. Это снижает галлюцинации, так как модель отвечает на основе проверенных внутренних документов, а не на общих знаниях. Фичи поиска (релевантность, позиция) становятся фичами генерации, повышая предсказуемость системы.

Для снижения галлюцинаций в корпоративном Q&A используйте существующий поиск как фильтр и ранжировщик контекста для LLM, а не подавайте модели сырой текст.