CPU3DИИ-инструменты для 3D, видео и звука

Moondream выпустила Parakeet Redux — 1.58-битную модель распознавания речи на 149 млн

На HuggingFace 18 сентября 2026 года опубликована модель moondream/parakeet-redux для automatic-speech-recognition. Это 1.58-битная версия parakeet-tdt-0.6b-v3: та же архитектура и токенизатор, но каждый вес энкодера принимает значение -1, 0 или +1. Веса занимают 178 МБ, модель работает в 113 раз быстрее реального времени на восьми ядрах x86 CPU и удерживает WER в пределах 0.3 от оригинала на английском, а на 25-язычном наборе FLEURS и на длинном аудио обходит его.

Что это значит

Модель содержит 149 млн параметров, самый большой файл весов — model.safetensors на 0.2 ГБ, формат safetensors. Лицензия — cc-by-4.0: можно использовать и дорабатывать при указании авторства. Запускается через Photon, который читает упакованные веса напрямую: AVX-512 VNNI на x86, NEON на ARM, Metal на GPU Apple. Все замеры скорости на странице модели сделаны именно в Photon. Для сравнения: полная версия parakeet-tdt-0.6b-v3 весит 1.2 ГБ, Redux — 178 МБ. Автор отмечает, что на фоновом шуме из девяти условий MUSAN Redux уступает оригиналу (9.04 против 6.72 WER), а на деловой речи — тоже (6.96 против 6.15). Зато на длинном аудио TED-LIUM Redux впереди: 2.51 против 2.71 WER. Модель ориентирована на CPU-инференс и заметно компактнее полноточного аналога, что делает её вариантом для распознавания речи на локальном железе без дискретного GPU. Следить за новостями об инструментах для локального запуска можно в ленте CPU3D.
Аудио речь на входе 25 языков FLEURS длинное аудио TED-LIUM -1 0 +1 1.58-битные веса энкодер: -1, 0, +1 149 млн параметров Photon Инференс AVX-512 VNNI на x86 NEON на ARM Metal на GPU Apple Текст распознанная речь WER в пределах 0.3 от оригинала Сравнение с оригиналом Redux: 178 МБ против 1.2 ГБ MUSAN: 9.04 против 6.72 WER TED-LIUM: 2.51 против 2.71 WER Parakeet Redux — 1.58-битная модель распознавания речи для CPU-инференса
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также