🎯 Проекты 2 мин чтения

LlamaIndex Document Summary Index: индексация по саммари вместо чанков

Простым языком

Вместо того чтобы нарезать документы на кусочки и искать по ним, Document Summary Index сначала просит LLM написать краткое содержание каждого документа. Когда приходит вопрос, LLM смотрит только на саммари и выбирает, в каких документах искать ответ. Это как иметь библиотекаря, который помнит содержание всех книг и сразу говорит, в какой книге искать нужную главу.

Что нового

  • Двухуровневый поиск: LLM-фильтр по саммари → точечный поиск в выбранных документах
  • Замена embedding всех чанков на LLM-генерацию саммари (однократно при индексации)
  • Маршрутизация запросов на основе семантического понимания всего документа, а не отдельного чанка
  • Совместимость с любым ретривером на втором уровне (векторный, BM25, гибридный)

Вердикт

Применять для QA-систем над корпусами длинных документов (отчёты, статьи, спецификации), где вопросы требуют понимания контекста всего документа. Не применять для коротких документов или когда бюджет на LLM-вызовы при индексации критичен. Ограничение: качество саммари определяет точность маршрутизации.

Document Summary Index: LLM сначала читает весь документ и пишет саммари, а поиск идёт по саммари — это экономит LLM-вызовы при запросах и улучшает релевантность для QA над длинными документами.