CPU3D3D、视频与音频的 AI 工具

Audio8-ASR-Infinite:内存占用恒定的流式语音识别

2026 年 9 月 21 日,HuggingFace 上发布了模型 Edge0/Audio8-ASR-Infinite,任务为 text-generation。作者将其描述为原生流式语音识别,面向最低延迟设计:模型每秒做出 12,5 次决策,而滑动 KV 缓存即使在 24/7 连续运行下也能将内存占用和延迟保持在恒定水平。支持中文和英文,并带有语义 VAD,可区分思考时的停顿和口吃与真正的语句结束。

这意味着什么

该模型包含 4,1 亿参数,权重以单个文件 model.safetensors 形式占用 7,6 GB。许可证为 Apache 2.0,也就是说该模型可以使用和修改,包括用于商业项目,但需保留署名。可通过 transformers 库启动,但对于无限长度的流式模式,作者推荐使用适配过的 vLLM 构建。平台上目前还没有量化版本,因此本地运行需要一块能够容纳完整 7,6 GB 权重加上工作上下文的显卡。 对于寻找可在自己的硬件上运行的语音识别工具的人来说,该模型首先吸引人的是恒定的内存占用:滑动 KV 缓存不会让消耗随时间增长,这在流式 ASR 模型中很少见。想要跟踪量化版本以及该领域新模型的出现,可以关注 CPU3D 动态
Audio8-ASR-Infinite:流式语音识别 音频流 麦克风或文件 中文和英文 语义 VAD 区分停顿 从话轮结束 Audio8-ASR-Infinite 4.1 亿参数 权重 7.6 GB Apache 2.0 方案 12.5 次/秒 最低延迟 滑动 KV 缓存 内存占用恒定 文本 24/7 持续运行内存不增长 vLLM 运行 transformers 适配版 vLLM GPU 硬件 显卡 7.6 GB+
该方法是如何构成的。示意图根据这篇简讯绘制。

相关阅读