🆕 Новые модели 2 мин чтения

NVIDIA релизила Nemotron-Labs Diffusion LMs: генерация текста со скоростью света

NVIDIA опубликовала на Hugging Face семейство языковых моделей на основе диффузионной архитектуры (DLM). Ключевое обещание — генерация текста со скоростью, приближенной к скорости света, за счёт параллельного предсказания всех токенов одновременно.

Что

NVIDIA выпустила семейство моделей Nemotron-Labs Diffusion Language Models (DLM) на Hugging Face. Это языковые модели, построенные не на стандартной авторегрессионной архитектуре (предсказание следующего токена), а на диффузионном процессе, заимствованном из генерации изображений.

Как

Вместо последовательной генерации токенов один за другим, DLM предсказывают все токены в последовательности параллельно. Модель начинает с «зашумлённой» последовательности (например, из масок или случайных токенов) и постепенно «денойзит» её, уточняя предсказания на каждом шаге. Это позволяет генерировать текст за фиксированное число шагов (например, 10-20), а не за число токенов, что даёт выигрыш в latency для длинных последовательностей.

Цифры

В блоге обещается значительное ускорение по сравнению с авторегрессионными моделями. Конкретные бенчмарки по throughput и latency на момент публикации поста не приведены — они заявлены как доступные в отдельном техническом отчёте. Упоминается, что архитектура особенно эффективна для задач с длинным контекстом и пакетной генерации.

Что перенять

Диффузионный подход к генерации текста — это паттерн, который стоит изучить для задач, где критична latency при генерации длинных последовательностей. Вместо оптимизации авторегрессионного декодирования (KV-кэш, speculative decoding) можно рассмотреть смену парадигмы на параллельное предсказание. Это особенно актуально для систем реального времени или высоконагруженных API, где время до получения полного ответа (TTFT и общая генерация) является узким местом.

Диффузионные языковые модели генерируют все токены параллельно за фиксированное число шагов (10-20), а не последовательно за N шагов — это потенциально даёт выигрыш в latency для длинных последовательностей, но требует проверки на конкретных бенчмарках.