MoRoute 提出用于多模态视频生成的动态层路由方案
MoRoute 的研究人员发表了一篇论文,提出通过动态层路由将冻结的视觉-语言模型(VLM)与预训练的视频扩散 Transformer(DiT)结合起来。该方法允许每个 DiT 块在当前生成阶段选择最相关的 VLM 层,并直接将图像和视频嵌入到 token 序列中。详情见 arXiv 上的文章。
方法的工作原理。示意图根据这篇简讯绘制。
Switch to the English version? It is the same page at the same address, with a language prefix.
Other languages: Русский
SPADE 无需微调即可加速视频扩散 Transformer 中的注意力机制研究人员推出了 SPADE——一种稀疏注意力引擎,无需微调模型即可加速视频扩散 Transformer 的推理。该论文于 2026 年 8 月 4 日发布在 arXiv 上。作者提出了三个组件:规格
UniMoCa 将人体运动与相机控制统一为单一视觉表示研究人员推出了 UniMoCa——一种将人体运动和相机轨迹都转换为统一视觉表示(称为 Motion-Camera Visual Proxy,MCVP)的方法。该方法不再向模型输入异构信号
HuggingFace 新模型 h3-vbvr 解决 image-to-video 任务2026年8月18日,HuggingFace 上发布了模型 Patarapoom/h3-vbvr,任务为 image-to-video。发布时已有 2434 次下载,0 个「喜欢」标记。代码已开源。这意味着什么 该模型属于 te
小米在 HuggingFace 发布 MiMo-V2.6-Flash-RL2026 年 9 月 21 日,XiaomiMiMo/MiMo-V2.6-Flash-RL 模型在 HuggingFace 上发布,任务为 text-generation。作者将其描述为 MiMo-V2.6 系列的 efficiency-balanced checkpoint,该系列围绕 reinf…