Moondream выпустила Parakeet Redux — 1.58-битную модель распознавания речи на 149 млн
На HuggingFace 18 сентября 2026 года опубликована модель moondream/parakeet-redux для automatic-speech-recognition. Это 1.58-битная версия parakeet-tdt-0.6b-v3: та же архитектура и токенизатор, но каждый вес энкодера принимает значение -1, 0 или +1. Веса занимают 178 МБ, модель работает в 113 раз быстрее реального времени на восьми ядрах x86 CPU и удерживает WER в пределах 0.3 от оригинала на английском, а на 25-язычном наборе FLEURS и на длинном аудио обходит его.
Что это значит
Модель содержит 149 млн параметров, самый большой файл весов — model.safetensors на 0.2 ГБ, формат safetensors. Лицензия — cc-by-4.0: можно использовать и дорабатывать при указании авторства. Запускается через Photon, который читает упакованные веса напрямую: AVX-512 VNNI на x86, NEON на ARM, Metal на GPU Apple. Все замеры скорости на странице модели сделаны именно в Photon.
Для сравнения: полная версия parakeet-tdt-0.6b-v3 весит 1.2 ГБ, Redux — 178 МБ. Автор отмечает, что на фоновом шуме из девяти условий MUSAN Redux уступает оригиналу (9.04 против 6.72 WER), а на деловой речи — тоже (6.96 против 6.15). Зато на длинном аудио TED-LIUM Redux впереди: 2.51 против 2.71 WER.
Модель ориентирована на CPU-инференс и заметно компактнее полноточного аналога, что делает её вариантом для распознавания речи на локальном железе без дискретного GPU. Следить за новостями об инструментах для локального запуска можно в ленте CPU3D.Как устроен метод. Схема нарисована по этой заметке.