3D 与视频 AI 生成器动态
关于工具变化的简讯:发布了新版本、许可证变更、新增对其他平台的支持。不转述新闻稿:如果某个说法无法关联到代码仓库、模型页面或官方网站,就不会发布该简讯。
文章
37 篇文章
UniMoCa 将人体运动与相机控制统一为单一视觉表示研究人员推出了 UniMoCa——一种将人体运动和相机轨迹都转换为统一视觉表示(称为 Motion-Camera Visual Proxy,MCVP)的方法。该方法不再向模型输入异构信号
MoRoute 提出用于多模态视频生成的动态层路由方案MoRoute 的研究人员发表了一篇论文,提出通过动态层路由将冻结的视觉-语言模型(VLM)与预训练的视频扩散 Transformer(DiT)相结合。该方法允许每个块
ROAD 通过迁移判别模型知识降低 3D 生成训练成本ROAD(Reciprocal-Objective Alignment of Discriminative Semantics for 3D Shape Generation)论文作者提出一种方法,仅在训练阶段使用判别式 3D 模型,以降低生成的计算成本。关键
Wan2.2 借助 DAR 方法学会根据动画网格渲染视频研究人员提出了 DAR 方法,可将预训练视频模型 Wan2.2 转变为由动画网格、相机轨迹和参考图像控制的渲染器。该方法不使用深度图(其中相机和物体的运动混合在一起)
FreqForcing 将自回归视频生成延长至两分钟,无需微调2026 年 7 月 29 日,arXiv 上发布了论文 FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring。作者研究了自回归视频扩散模型的问题:在逐帧生成时,误差会累积,
VoxelModel-v1:HuggingFace 上新的开源 text-to-3d 模型HuggingFace 上发布了 bench-labs/VoxelModel-v1 模型,用于解决 text-to-3d 任务。该模型于 2026 年 7 月 26 日上线,代码已开源。开发者未说明显存要求、导出格式、许可证等
Lightricks 发布 LTX-2.5,支持 image-to-video 任务Lightricks 在 HuggingFace 上发布了支持 image-to-video 任务的 LTX-2.5 模型。发布日期为 2026 年 7 月 23 日,该模型有 39 次下载和 124 个“喜欢”标记。代码已开源,详情见模型页面。这意味着什么