CPU3D3D、视频与音频的 AI 工具

Whistle:面向 CPU 的语音识别模型已在 HuggingFace 发布

2026 年 9 月 30 日,HuggingFace 上发布了模型 Cactus-Compute/whistle,任务为 automatic-speech-recognition。作者将其描述为一款 speech-to-text 模型,面向移动设备、可穿戴电子设备、机器人、智能家居、汽车和微控制器。

这意味着什么

该模型以 apache-2.0 许可证分发。最大的权重文件 checkpoints/whistle.safetensors 占用 0.2 GB,而作者声称整个模型打包在一个 16.9 MB 的文件中。权重以 safetensors 格式发布。通过 cactus-needle 引擎启动,据作者描述,该引擎在 CPU 上运行,无需 GPU,也没有外部依赖。 Whistle 在设备上执行三项任务:对时长不超过 30 秒的 16 kHz 单声道音频进行七种语言的转录,包括俄语——未提及——英语、德语、法语、西班牙语、意大利语、荷兰语和波兰语;输出每个词的时间戳及其概率;提取 speech embedding——编码器输出,每 80 ms 帧一行。该模型复用 .cact 容器、Cactus Quants 量化、SIMD 内核以及来自 Needle 的 KV 缓存,因此在已运行 Needle 的设备上,Whistle 可在同一二进制文件中启动,无需第二个运行时。解码器深度可在加载时通过 --audio-depth 标志选择。 对于寻找无需 GPU、可在自己的硬件上运行的语音识别工具的人来说,Whistle 是拥有开源许可证并声称支持 CPU 的候选之一。可以在 CPU3D 动态中关注此类模型的出现。
Whistle:CPU 语音识别 音频 16 kHz 单声道,最长 30 秒 Whistle safetensors,16.9 MB cactus-needle CPU,无需 GPU 设备上的三项任务 转写 语音转文本 英语、德语、 法语、西班牙语、 意大利语、荷兰语、 波兰语 时间戳 每个词 带概率 嵌入 编码器输出 每行 对应 80 ms 帧 许可证 apache-2.0 · 权重 safetensors · 在 CPU 上运行,无外部依赖
该方法的构造。示意图根据这篇简讯绘制。

相关阅读