Voxtral Mini 4B Realtime Arabic вышла для потокового распознавания арабской речи
Mistral AI опубликовала на HuggingFace модель Voxtral-Mini-4B-Realtime-Arabic — потоковую speech-to-text модель для арабских диалектов и современного стандартного арабского. Она дообучена из Voxtral-Mini-4B-Realtime-2602 и заточена под живой звук с переключением кодов, когда говорящий чередует языки в одной беседе. При задержке транскрипции 480 мс модель показывает средний Character Error Rate 8,82% на семи арабских бенчмарках.
Что это значит
Модель содержит 4,4 млрд параметров, веса выложены в BF16. Самый большой файл — consolidated.safetensors на 8,3 ГБ, весь репозиторий занимает 16,5 ГБ. Для запуска автор предлагает vLLM с поддержкой Voxtral Realtime и аудиозависимостями mistral-common: звук передаётся по WebSocket на эндпоинт /v1/realtime. Лицензию разработчик на странице не указал.
Для локального запуска потребуется видеокарта, способная вместить BF16-веса на 16,5 ГБ, плюс запас под активации и потоковый вывод. Квантованных сборок в репозитории нет — только safetensors в полной точности. Подойдёт это в первую очередь тем, кто делает живые субтитры или голосовые интерфейсы на арабском и уже работает с vLLM. Больше новостей об инструментах, которые запускаются на своём железе, — в ленте CPU3D.Как устроен метод. Схема нарисована по этой заметке.