Microsoft выпустила VibeVoice-ASR-Streaming-7B для потокового распознавания речи
На HuggingFace 2 сентября 2026 года опубликована модель microsoft/VibeVoice-ASR-Streaming-7B с задачей automatic-speech-recognition. Модель транскрибирует потоковую речь, определяя, кто из говорящих что сказал, поддерживает пользовательские горячие слова для улучшения распознавания имён и технических терминов и работает с десятью языками, включая русский. Код выложен в открытый доступ.
Что это значит
Модель содержит 8.7 млрд параметров, веса в репозитории занимают 16.2 ГБ в формате safetensors, самый большой файл — 2.3 ГБ. Лицензия MIT, запуск через transformers. Разработчик не уточняет требования к видеопамяти и наличие готовых квантованных сборок.
Для локального запуска потребуется машина с достаточным объёмом памяти под 16.2 ГБ весов. Следить за новостями об инструментах для локального запуска можно в ленте CPU3D.Как устроен метод. Схема нарисована по этой заметке.