LlamaIndex: пошаговый паттерн QA-системы с оценкой через LLM-as-a-Judge
Простым языком
Это пошаговая инструкция, как собрать систему, которая отвечает на вопросы по вашим документам, и автоматически проверять качество этих ответов. Система ищет нужные куски текста в базе знаний, генерирует ответ, а затем другая языковая модель выставляет оценку — насколько ответ полный и точный.
Что нового
- Классический RAG-пайплайн: загрузка → чанкинг → эмбеддинги → retrieval → генерация
- Этап оценки через LLM-as-a-Judge вместо ручной разметки
- Критерии оценки: полнота (completeness) и релевантность (relevance)
- Итеративный цикл улучшения: меняешь чанкинг/промпт → оцениваешь → сравниваешь
Вердикт
Паттерн стоит применять в любом RAG-проекте, где нет бюджета на ручную разметку. Ограничение: судья-модель требует калибровки, иначе оценки могут быть смещены.
Для оценки RAG-системы используйте LLM-as-a-Judge: вторая модель оценивает полноту и релевантность ответа по шкале, заменяя ручную разметку и позволяя итеративно улучшать чанкинг и промпты.