MoRoute 提出用于多模态视频生成的动态层路由方案
MoRoute 的研究人员发表了一篇论文,提出通过动态层路由将冻结的视觉-语言模型(VLM)与预训练的视频扩散 Transformer(DiT)结合起来。该方法允许每个 DiT 块在当前生成阶段选择最相关的 VLM 层,并直接将图像和视频嵌入到 token 序列中。详情见 arXiv 上的文章。
方法的工作原理。示意图根据这篇简讯绘制。
Switch to the English version? It is the same page at the same address, with a language prefix.
Other languages: Русский
Lightricks 发布 LTX-2.5,支持 image-to-video 任务Lightricks 在 HuggingFace 上发布了支持 image-to-video 任务的 LTX-2.5 模型。发布日期为 2026 年 7 月 23 日,该模型有 39 次下载和 124 个“喜欢”标记。代码已开源,详情见模型页面。这意味着什么
Luce 推出基于单张图像的 3D 资源生成,支持 PBR 材质与重新照明研究人员在 arXiv 上发布了论文 Luce: Relightable Gaussians for 3D Asset Generation,提出了一种从单张图像生成 3D 模型并支持物理正确渲染的方法。该模型使用体素化
SPADE 无需微调即可加速视频扩散 Transformer 中的注意力机制研究人员推出了 SPADE——一种稀疏注意力引擎,无需微调模型即可加速视频扩散 Transformer 的推理。该论文于 2026 年 8 月 4 日发布在 arXiv 上。作者提出了三个组件:规格
OctWorld 发布:基于八叉树 3D 记忆的长时一致视频生成器2026 年 9 月 3 日,arXiv 上发布了 OctWorld 论文——一个基于扩散模型的视频生成框架,具备持久 3D 记忆。它可根据单张图像,沿指定相机轨迹生成长视频序列,并保持一致性。