GPT-4 vs Prometheus: бенчмарк judge-моделей для RAG-оценки от LlamaIndex
Что произошло
LlamaIndex провели прямое сравнение GPT-4 и open-source модели Prometheus в роли judge для оценки RAG-пайплайнов. Prometheus показал корреляцию 0.9 с человеческими оценками и работает дешевле GPT-4 в 10 раз.
Детали
- Prometheus (Llama-2-13B-based) показал корреляцию 0.90 с human judgments vs 0.87 у GPT-4
- Стоимость оценки: $0.002/пример (Prometheus) vs $0.02/пример (GPT-4) — разница 10×
- Latency: ~2 сек (Prometheus) vs ~4 сек (GPT-4) на пример
- Метрики: relevance, faithfulness, context quality по шкале 1–5
- Согласованность моделей: 82% совпадений при бинарной классификации
- Фреймворк оценки: библиотека ragas
Что это значит
Для инженеров, строящих RAG-пайплайны с автоматической оценкой в CI/CD: Prometheus позволяет сократить затраты на judge в 10 раз без потери качества, при этом rubric-based подход делает оценки более прозрачными для аудита.
Prometheus (13B open-source) коррелирует с human judgments на уровне 0.90 и стоит в 10 раз дешевле GPT-4 при оценке RAG — благодаря rubric-based scoring результаты воспроизводимее, чем у проприетарных моделей.