2026 年 9 月 21 日,HuggingFace 上发布了模型
Edge0/Audio8-ASR-Infinite,任务为 text-generation。作者将其描述为原生流式语音识别,面向最低延迟设计:模型每秒做出 12,5 次决策,而滑动 KV 缓存即使在 24/7 连续运行下也能将内存占用和延迟保持在恒定水平。支持中文和英文,并带有语义 VAD,可区分思考时的停顿和口吃与真正的语句结束。
这意味着什么
该模型包含 4,1 亿参数,权重以单个文件 model.safetensors 形式占用 7,6 GB。许可证为 Apache 2.0,也就是说该模型可以使用和修改,包括用于商业项目,但需保留署名。可通过 transformers 库启动,但对于无限长度的流式模式,作者推荐使用适配过的 vLLM 构建。平台上目前还没有量化版本,因此本地运行需要一块能够容纳完整 7,6 GB 权重加上工作上下文的显卡。
对于寻找可在自己的硬件上运行的语音识别工具的人来说,该模型首先吸引人的是恒定的内存占用:滑动 KV 缓存不会让消耗随时间增长,这在流式 ASR 模型中很少见。想要跟踪量化版本以及该领域新模型的出现,可以关注
CPU3D 动态。
该方法是如何构成的。示意图根据这篇简讯绘制。