CPU3DИИ-инструменты для 3D, видео и звука

Microsoft выпустила VibeVoice-ASR-Streaming-7B для потокового распознавания речи

На HuggingFace 2 сентября 2026 года опубликована модель microsoft/VibeVoice-ASR-Streaming-7B с задачей automatic-speech-recognition. Модель транскрибирует потоковую речь, определяя, кто из говорящих что сказал, поддерживает пользовательские горячие слова для улучшения распознавания имён и технических терминов и работает с десятью языками, включая русский. Код выложен в открытый доступ.

Что это значит

Модель содержит 8.7 млрд параметров, веса в репозитории занимают 16.2 ГБ в формате safetensors, самый большой файл — 2.3 ГБ. Лицензия MIT, запуск через transformers. Разработчик не уточняет требования к видеопамяти и наличие готовых квантованных сборок. Для локального запуска потребуется машина с достаточным объёмом памяти под 16.2 ГБ весов. Следить за новостями об инструментах для локального запуска можно в ленте CPU3D.
VibeVoice-ASR-Streaming-7B потоковое распознавание речи Потоковая речь аудио в реальном времени VibeVoice-ASR-Streaming-7B 8.7 млрд параметров веса 16.2 ГБ safetensors Транскрипт текст с говорящими Возможности модели Диаризация кто что сказал Горячие слова имена и термины Многоязычность включая русский Лицензия MIT · запуск через transformers
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также