🎯 Проекты 2 мин чтения

LongLLMLingua: prompt compression для RAG с экономией до 20× токенов и решением middle loss

Что произошло

LlamaIndex интегрировал LongLLMLingua — алгоритм сжатия промптов, который убирает «middle loss» (потерю информации из середины контекста) и снижает стоимость RAG-запросов. В бенчмарках сжатие достигает 20× при сохранении качества ответов.

Детали

  • Сжатие контекста до 20× при ~95% сохранении качества ответов
  • Экономия на input-токенах до 94%
  • Ускорение latency до 1.7× на длинных контекстах
  • Coarse-компрессия через GPT-2 Large (774M параметров)
  • Reorder-шаг решает проблему middle loss в длинных контекстах

Что это значит

Паттерн «дешёвая модель фильтрует → дорогая генерирует» — рабочий способ снизить RAG-затраты без потери качества, особенно при top-k > 5 и длинных чанках.

LongLLMLingua сжимает RAG-контекст до 20× через perplexity-scoring на дешёвой модели (GPT-2 Large), reorder строк решает middle loss, экономия на input-токенах до 94%.