LlamaIndex выпустила ParseBench — первый бенчмарк парсинга документов для AI-агентов
Что произошло
LlamaIndex представила ParseBench — бенчмарк для оценки качества парсинга документов в RAG-пайплайнах. Бенчмарк оценивает не просто извлечение текста, а точность ответов агента на основе распарсенных документов.
Детали
- ParseBench — первый бенчмарк, оценивающий парсинг документов через призму точности ответов AI-агента
- LlamaParse показал 85% точность на сложных PDF с таблицами, базовые парсеры — около 55%
- Бенчмарк включает PDF, таблицы и изображения с размеченными вопросами и эталонными ответами
- Оценка энд-ту-энд: парсинг → ответ агента → сравнение с эталоном
- Открытый репозиторий с датасетом и скриптами для воспроизведения
Что это значит
Для инженеров RAG-пайплайнов: появился инструмент для объективного сравнения парсеров на ваших данных вместо субъективной оценки «на глаз».
Для RAG-пайплайнов: оценивайте парсер по точности ответов агента на доменных вопросах, а не по качеству извлечённого текста — ParseBench даёт готовый фреймворк для этого.