Mistral AI 在 HuggingFace 上发布了模型
Voxtral-Mini-4B-Realtime-Arabic —— 一个面向阿拉伯语方言和现代标准阿拉伯语的流式 speech-to-text 模型。它由 Voxtral-Mini-4B-Realtime-2602 微调而来,专为带有语码转换的实时语音打造,即说话者在同一段对话中交替使用不同语言。在转录延迟为 480 毫秒时,该模型在七个阿拉伯语基准测试上的平均 Character Error Rate 为 8,82%。
这意味着什么
该模型包含 44 亿参数,模型权重以 BF16 发布。最大的文件是 8,3 GB 的 consolidated.safetensors,整个仓库占用 16,5 GB。作者建议使用支持 Voxtral Realtime 和 mistral-common 音频依赖的 vLLM 来运行:音频通过 WebSocket 传输到 /v1/realtime 端点。开发者在页面上未注明许可证。
要在本地运行,需要一块能够容纳 16,5 GB BF16 权重的显卡,外加用于激活值和流式输出的余量。仓库中没有量化版本——只有全精度的 safetensors。这首先适合那些制作阿拉伯语实时字幕或语音界面、并且已经在使用 vLLM 的人。更多关于可以在自己的硬件上运行的工具的动态,请见
CPU3D 动态。
该方法的原理。示意图根据这篇简讯绘制。