LocalAI v4.11.0:音频场景、故障转移链与决策模型
运行工具 LocalAI 发布了 v4.11.0 版本。该版本于 2026 年 10 月 2 日发布,新增了音频场景功能,可组合转录、说话人分离、声音事件检测和说话人姓名记忆;本地与远程目标之间的有序故障转移链;通过 /v1/systemone 进行决策的模型;签名的 OCI 模型库;以及 Kimodo text-to-animation。详情见 GitHub 上的发布说明。
该方法的构造。示意图根据这篇简讯绘制。
Switch to the English version? It is the same page at the same address, with a language prefix.
Other languages: Русский
MoRoute 提出用于多模态视频生成的动态层路由方案MoRoute 的研究人员发表了一篇论文,提出通过动态层路由将冻结的视觉-语言模型(VLM)与预训练的视频扩散 Transformer(DiT)相结合。该方法允许每个块
Lightricks 发布带 image-to-video 任务的 LTX-2.5Lightricks 在 HuggingFace 上发布了带 image-to-video 任务的 LTX-2.5 模型。发布时间为 23.07.2026,该模型有 39 次下载和 124 个「喜欢」标记。代码已开源,详情见模型页面。这意味着什么
OOOSplat 0.6.0:通过 MCP 管理任务与透明材质OOOSplat 0.6.0 发布。该版本新增对 MCP 的支持,可通过 Codex 等本地 AI 智能体管理生成任务,还带来多窗口任务管理器、对透明 PNG 和 MOV 的正确处理,以及 COLMAP 和 OOOBrush 的更新。这意味着什么
Qwen-Image-2.1 已在 HuggingFace 发布:基于 7B 模型的图像生成与编辑HuggingFace 上发布了模型 unsloth/Qwen-Image-2.1 —— 一款用于文本生成图像和编辑的统一模型。发布日期为 2026 年 9 月 23 日。该模型支持最多 10 张参考图像、本地编辑