CPU3DИИ-инструменты для 3D, видео и звука

Voxtral Mini 4B Realtime Arabic вышла для потокового распознавания арабской речи

Mistral AI опубликовала на HuggingFace модель Voxtral-Mini-4B-Realtime-Arabic — потоковую speech-to-text модель для арабских диалектов и современного стандартного арабского. Она дообучена из Voxtral-Mini-4B-Realtime-2602 и заточена под живой звук с переключением кодов, когда говорящий чередует языки в одной беседе. При задержке транскрипции 480 мс модель показывает средний Character Error Rate 8,82% на семи арабских бенчмарках.

Что это значит

Модель содержит 4,4 млрд параметров, веса выложены в BF16. Самый большой файл — consolidated.safetensors на 8,3 ГБ, весь репозиторий занимает 16,5 ГБ. Для запуска автор предлагает vLLM с поддержкой Voxtral Realtime и аудиозависимостями mistral-common: звук передаётся по WebSocket на эндпоинт /v1/realtime. Лицензию разработчик на странице не указал. Для локального запуска потребуется видеокарта, способная вместить BF16-веса на 16,5 ГБ, плюс запас под активации и потоковый вывод. Квантованных сборок в репозитории нет — только safetensors в полной точности. Подойдёт это в первую очередь тем, кто делает живые субтитры или голосовые интерфейсы на арабском и уже работает с vLLM. Больше новостей об инструментах, которые запускаются на своём железе, — в ленте CPU3D.
Voxtral Mini 4B Realtime Arabic потоковое распознавание арабской речи Живой звук арабские диалекты переключение кодов WebSocket эндпоинт /v1/realtime потоковая передача V Voxtral Mini 4B 4,4 млрд параметров веса BF16 дообучена из Realtime-2602 T текст Ключевые характеристики Задержка 480 мс CER 8,82% Размер файла 8,3 ГБ Репозиторий 16,5 ГБ Применение: живые субтитры и голосовые интерфейсы на арабском Запуск: vLLM + видеокарта с запасом под активации
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также