CPU3D3D、视频与音频的 AI 工具

LocalAI v4.11.0:音频场景、故障转移链与决策模型

运行工具 LocalAI 发布了 v4.11.0 版本。该版本于 2026 年 10 月 2 日发布,新增了音频场景功能,可组合转录、说话人分离、声音事件检测和说话人姓名记忆;本地与远程目标之间的有序故障转移链;通过 /v1/systemone 进行决策的模型;签名的 OCI 模型库;以及 Kimodo text-to-animation。详情见 GitHub 上的发布说明。

这意味着什么

对于在自己的机器上运行模型的人来说,该版本带来了几项实用变化。音频场景允许将语音识别、说话人分离、声音事件检测和说话人识别整合到一个场景中:Studio 能够对录音进行说话人分离,显示清晰的区间,并按姓名登记选定的说话人。故障转移链使得可以通过多个目标——本地和远程——保持同一个模型可用,在确定响应之前进行重试,监控目标的健康状况和切换情况,并通过 API、MCP 工具或 React UI 固定目标。 决策模型现在会宣传其使用场景,并通过 /v1/systemone 回答关于选择、评估和「noul」的结构化问题,带有验证和库中的独立模型。签名的 OCI 库允许将完整的模型库作为 OCI 工件分发,并通过 Sigstore 进行验证。该版本包含 243 个合并的 pull request、353 次提交和 79 条新的库条目。开发者未说明显存要求或各个模型的参数。 可以在 CPU3D 动态中关注在自己的硬件上运行神经网络的工具新闻。
LocalAI v4.11.0 — 2026年10月2日 音频场景、故障转移、决策模型、OCI 仓库、Kimodo 音频场景 转录 说话人分离 事件检测 说话人姓名 Studio:干净区间 故障转移链 本地 + 远程 重试 目标健康 API, MCP, React UI 决策模型 /v1/systemone 选择、评估、noul 验证 仓库中的独立模型 OCI 仓库 完整仓库 OCI 制品 Sigstore 校验 已签名仓库 Kimodo text-to-animation 动画生成 243 个 pull request · 353 次提交 · 79 条仓库新记录 显存要求未说明
该方法的构造。示意图根据这篇简讯绘制。

相关阅读