🎯 Проекты 1 мин чтения

LlamaParse ускорил RAG‑pipeline на 80 % за счёт оптимального размера чанков

Что произошло

В блоге LlamaIndex представлена методика подбора размера чанков для LlamaParse: при размере 512 токенов throughput вырос в 1,8 раз, а latency упала на 30 %. Исследование основано на публичных бенчмарках RAG‑pipeline.

Детали

  • Оптимальный размер чанка ≈ 512 токенов
  • Throughput ↑ 80 % (1 800 doc/s vs 1 000 doc/s)
  • Latency ↓ 30 % (84 мс vs 120 мс)
  • Снижение стоимости обработки ≈ 20 %

Что это значит

Эти цифры позволяют сразу уменьшить расходы и ускорить ответы в продуктивных RAG‑сервисах.

Подбирайте размер чанков около 500 токенов — это даёт максимум throughput и минимум latency в типичных RAG‑pipeline.