在 HuggingFace 上 2026 年 9 月 18 日发布了用于 automatic-speech-recognition 的模型 moondream/parakeet-redux。这是 parakeet-tdt-0.6b-v3 的 1.58 比特版本:架构和分词器相同,但编码器的每个权重只取 -1、0 或 +1。权重占用 178 MB,模型在八核 x86 CPU 上的运行速度是实时速度的 113 倍,在英语上的 WER 保持在原版 0.3 以内,而在 25 种语言的 FLEURS 数据集以及长音频上则超过原版。
这意味着什么
模型包含 149 百万个参数,最大的权重文件是 0.2 GB 的 model.safetensors,格式为 safetensors。许可证为 cc-by-4.0:在注明作者的情况下可以使用和修改。通过 Photon 启动,它直接读取打包后的权重:x86 上使用 AVX-512 VNNI,ARM 上使用 NEON,Apple GPU 上使用 Metal。模型页面上所有速度测试都是在 Photon 中完成的。
作为对比:完整版 parakeet-tdt-0.6b-v3 大小为 1.2 GB,Redux 为 178 MB。作者指出,在 MUSAN 的九种背景噪声条件下,Redux 不如原版(WER 9.04 对 6.72),在商务语音上也是如此(6.96 对 6.15)。但在长音频 TED-LIUM 上 Redux 领先:WER 2.51 对 2.71。
该模型面向 CPU 推理,并且比全精度同类模型明显更紧凑,这使它成为在没有独立 GPU 的本地硬件上进行语音识别的一个选择。可以关注
CPU3D 动态 中关于本地运行工具的新闻。
该方法的原理。示意图根据这篇简讯绘制。