NVIDIA Research представила RAG‑систему с 1 Мток контекстом
Что произошло
NVIDIA Research опубликовала исследование, в котором предложена архитектура Retrieval‑Augmented Generation для LLM с контекстным окном в 1 млн токенов. На бенчмарке MMLU система превзошла базовый LLM на 12 % при почти том же уровне пропускной способности.
Детали
- Контекстный размер до 1 млн токенов
- Throughput 150 токенов/сек при полном контексте
- MMLU accuracy 71,2 % vs 59,1 % у базовой модели
- Стоимость инференса ↑ 8 % при 8‑к‑токеновом базовом контексте
- Dense‑sparse индекс ускоряет retrieval в 5×
Что это значит
Для инженеров, разрабатывающих RAG‑системы, это демонстрирует, как масштабировать контекст без пропорционального роста затрат.
Гибридный dense‑sparse индекс + перекрывающиеся окна позволяют LLM с 1 Мток контекстом сохранять почти ту же throughput, повышая точность на 12 % в MMLU.