LongLLMLingua: prompt compression для RAG с экономией до 20× токенов и решением middle loss
Что произошло
LlamaIndex интегрировал LongLLMLingua — алгоритм сжатия промптов, который убирает «middle loss» (потерю информации из середины контекста) и снижает стоимость RAG-запросов. В бенчмарках сжатие достигает 20× при сохранении качества ответов.
Детали
- Сжатие контекста до 20× при ~95% сохранении качества ответов
- Экономия на input-токенах до 94%
- Ускорение latency до 1.7× на длинных контекстах
- Coarse-компрессия через GPT-2 Large (774M параметров)
- Reorder-шаг решает проблему middle loss в длинных контекстах
Что это значит
Паттерн «дешёвая модель фильтрует → дорогая генерирует» — рабочий способ снизить RAG-затраты без потери качества, особенно при top-k > 5 и длинных чанках.
LongLLMLingua сжимает RAG-контекст до 20× через perplexity-scoring на дешёвой модели (GPT-2 Large), reorder строк решает middle loss, экономия на input-токенах до 94%.