Whistle: модель распознавания речи для CPU вышла на HuggingFace
30 сентября 2026 года на HuggingFace опубликована модель Cactus-Compute/whistle с задачей automatic-speech-recognition. Автор описывает её как speech-to-text модель для мобильных устройств, носимой электроники, роботов, умного дома, автомобилей и микроконтроллеров.
Что это значит
Модель распространяется по лицензии apache-2.0. Самый большой файл весов — checkpoints/whistle.safetensors — занимает 0.2 ГБ, при этом автор утверждает, что вся модель упакована в один файл размером 16.9 МБ. Веса выложены в формате safetensors. Запускается через движок cactus-needle, который, по словам автора, работает на CPU без GPU и без внешних зависимостей.
Whistle выполняет три задачи на устройстве: транскрипция 16 кГц моно-аудио длительностью до 30 секунд на семи языках, включая русский не упомянут — английский, немецкий, французский, испанский, итальянский, нидерландский и польский; выдача временных меток для каждого слова с вероятностями; извлечение speech embedding — выхода энкодера по одной строке на каждые 80 мс кадра. Модель переиспользует контейнер .cact, квантизацию Cactus Quants, SIMD-ядра и KV-кэш от Needle, поэтому на устройстве, где уже работает Needle, Whistle запускается в том же бинарнике без второго рантайма. Глубину декодера можно выбирать при загрузке флагом --audio-depth.
Для тех, кто ищет инструменты распознавания речи, работающие на собственном железе без GPU, Whistle — один из кандидатов с открытой лицензией и заявленной поддержкой CPU. Следить за появлением подобных моделей можно в ленте CPU3D.Как устроен метод. Схема нарисована по этой заметке.