🎯 Проекты 1 мин чтения

LlamaIndex выпустила ParseBench — первый бенчмарк парсинга документов для AI-агентов

Что произошло

LlamaIndex представила ParseBench — бенчмарк для оценки качества парсинга документов в RAG-пайплайнах. Бенчмарк оценивает не просто извлечение текста, а точность ответов агента на основе распарсенных документов.

Детали

  • ParseBench — первый бенчмарк, оценивающий парсинг документов через призму точности ответов AI-агента
  • LlamaParse показал 85% точность на сложных PDF с таблицами, базовые парсеры — около 55%
  • Бенчмарк включает PDF, таблицы и изображения с размеченными вопросами и эталонными ответами
  • Оценка энд-ту-энд: парсинг → ответ агента → сравнение с эталоном
  • Открытый репозиторий с датасетом и скриптами для воспроизведения

Что это значит

Для инженеров RAG-пайплайнов: появился инструмент для объективного сравнения парсеров на ваших данных вместо субъективной оценки «на глаз».

Для RAG-пайплайнов: оценивайте парсер по точности ответов агента на доменных вопросах, а не по качеству извлечённого текста — ParseBench даёт готовый фреймворк для этого.