CPU3D3D、视频与音频的 AI 工具

MoRoute 提出用于多模态视频生成的动态层路由方案

MoRoute 的研究人员发表了一篇论文,提出通过动态层路由将冻结的视觉-语言模型(VLM)与预训练的视频扩散 Transformer(DiT)结合起来。该方法允许每个 DiT 块在当前生成阶段选择最相关的 VLM 层,并直接将图像和视频嵌入到 token 序列中。详情见 arXiv 上的文章

这意味着什么

MoRoute 的工作涉及多模态视频生成器的基本架构,而非具体产品。我们指南中的任何工具——LTX-VideoCogVideoX(智谱 CogVideoX)Pyramid Flow(快手 Pyramid Flow)——均未使用所述的 VLM 与 DiT 之间的动态路由方法。这三款生成器都解决更具体的任务(text-to-video 或 image-to-video),并且未声称支持在同一模型中任意组合文本、图像和视频作为条件。 我们的工具参数表中既没有关于使用 VLM 理解上下文的信息,也没有层路由机制的说明。LTX-Video、CogVideoX 和 Pyramid Flow 仍然是专门的解决方案,而 MoRoute 描述了一种旨在统一多样化视频生成和编辑任务的研究架构。 目前,该方法仅以科学出版物的形式存在,谈论其出现在用户工具中还为时过早。关于视频生成的总体部分可在指南页面上查看。
MoRoute:面向多模态视频生成的动态层路由 输入数据 文本、图像、视频 在同一模型中 VLM 视觉-语言 模型(已冻结) DiT 视频扩散 transformer(预训练) 动态层路由 每个 DiT 块选择相关的 VLM 层 用于当前生成阶段 生成的视频 生成与编辑的统一 研究架构,未在 LTX-Video、CogVideoX 或 Pyramid Flow 中实现
方法的工作原理。示意图根据这篇简讯绘制。

相关阅读