MoRoute 提出用于多模态视频生成的动态层路由方案
MoRoute 的研究人员发表了一篇论文,提出通过动态层路由将冻结的视觉-语言模型(VLM)与预训练的视频扩散 Transformer(DiT)结合起来。该方法允许每个 DiT 块在当前生成阶段选择最相关的 VLM 层,并直接将图像和视频嵌入到 token 序列中。详情见 arXiv 上的文章。
方法的工作原理。示意图根据这篇简讯绘制。
Switch to the English version? It is the same page at the same address, with a language prefix.
Other languages: Русский
基于扩散的视频去反射新方法简讯研究人员发布了论文 From Synthesis to Removal: Physics-Grounded Reflection Simulation and Diffusion-Based Video Dereflection,该论文于 2026 年 8 月 12 日发表。作者描述了一个由三个组件…
EchoCache 利用音频信号能量加速声音驱动视频生成arXiv 报道了 EchoCache 的工作——一种用于 audio-driven video generation(A2V)的缓存方法。作者发现了现有方法中两类不一致:时间-语义不一致和计算-存储不一致。所提出的解决方案利用
SQuad 加速 Wan 2.2 视频生成,注意力机制缩减 67 倍SQuad 的作者提出了一种用于视频扩散 Transformer 的 sub-quadratic attention 蒸馏方法。他们不是从头训练模型,而是分两个阶段蒸馏现成的完整尺寸模型 Wan 2.2 5B:Flow-Matching 监督微调和
HelloWorld — 用于视频世界中与角色社交互动的模型研究人员推出了 HelloWorld——一种视频世界模型,用户可以与屏幕上的角色进行互动。按下按钮后,角色会对观众做出反应:转身、挥手、点头或说出一句简短的话。