Yandex споттер‑модель «Алиса» сжата до 200 KB и потребляет в 10 раз меньше энергии
Что произошло
Для локального распознавания активации «Алиса» Яндекс уменьшил модель‑споттер с 1,7 МБ до 200 KB, используя дистилляцию, глубинную разделимую свёртку и 8‑битное квантование, а также добавил VAD и чередование микрофонов, что снизило энергопотребление в 10 раз.
Детали
- Исходный размер споттера ≈ 1,7 МБ, доступная память ≈ 208 KB.
- После трёхэтапного сжатия модель помещается в 200 KB.
- Квантование до 8 бит уменьшило размер в 4 раза.
- Энергопотребление сократилось в 10 раз благодаря VAD и чередованию микрофонов.
Что это значит
Это решение позволяет внедрять локальное голосовое управление в маломощные устройства без постоянного подключения к облаку.
Комбинация дистилляции, DSC и 8‑битного квантования позволяет уместить LLM‑модель в 200 KB и снизить энергопотребление в 10 раз, что практично для NPU‑устройств с 208 KB памяти.