HuggingFace 上发布了模型
Cloudflare/clef-omni。这是一个拥有 353 亿参数的 mixture-of-experts 模型,它接受文本、JSON、图像、音频或视频形式的状态,并针对类型化问题的答案选项返回概率。该模型没有自由文本生成能力——只能对选项进行评分。模型权重以 safetensors 格式发布,最大的文件占 4.7 GB,整个仓库为 65.9 GB。许可证为 apache-2.0,通过 transformers 运行。
这意味着什么
模型页面中的 text-to-audio 任务并不意味着通常意义上的语音或声音生成。Clef-Omni 不创建音频文件:它读取状态(包括音频),并针对预先给定的答案选项输出概率。这是一个决策工具,而不是合成器。
在我们的
音频生成器栏目中,收集的是机制不同的模型。
ChatTTS 是一个 text-to-audio 语音生成器,它创建音频片段,30 秒音频需要至少 4 GB 显存。
XTTS 和
Fish Speech 解决 text-to-speech 任务:根据文本合成语音,支持声音克隆,并在 CUDA 上运行。这三者都输出音频,而 clef-omni 只返回答案选项的 logits。
对于寻找声音或语音生成工具的人来说,clef-omni 并不能替代指南中已有的模型。它属于另一类系统——多模态分类器,其实际应用领域在于决策自动化,而非音频合成。
方法是如何构成的。示意图根据这篇简讯绘制。