CPU3D3D、视频与音频的 AI 工具

微软发布 VibeVoice-ASR-Streaming-7B 用于流式语音识别

2026年9月2日,HuggingFace 上发布了模型 microsoft/VibeVoice-ASR-Streaming-7B,任务为自动语音识别(automatic-speech-recognition)。该模型可转录流式语音,识别说话人身份及其所说内容,支持用户自定义热词以提升人名和技术术语的识别效果,并支持包括俄语在内的十种语言。代码已开源。

这意味着什么

该模型包含 87 亿参数,仓库中的权重以 safetensors 格式存储,占用 16.2 GB,最大文件为 2.3 GB。许可证为 MIT,可通过 transformers 运行。开发者未明确说明显存要求,也未提供现成的量化版本。 要在本地运行,需要一台内存足以容纳 16.2 GB 权重的机器。有关本地运行工具的更多动态,可关注 CPU3D 动态
VibeVoice-ASR-Streaming-7B 流式语音识别 流式语音 实时音频 VibeVoice-ASR-Streaming-7B 87亿参数 权重16.2 GB safetensors 转录文本 带说话人的文本 模型能力 说话人分离 谁说了什么 热词 名称和术语 多语言 包括俄语 MIT许可证 · 通过transformers运行
方法原理示意图。此图根据该简讯绘制。

相关阅读