CPU3D3D、视频与音频的 AI 工具

Wan2.2 借助 DAR 方法学会根据动画网格渲染视频

研究人员提出了一种名为 DAR 的方法,可将预训练的视频模型 Wan2.2 转变为由动画网格、相机轨迹和参考图像驱动的渲染器。与将相机运动和物体运动混在一起的深度图不同,DAR 使用一对 tracking 和 world position 数据,使模型能够更精确地区分场景动画与相机移动。在包含 68 个场景的 DAR-4D 基准测试中,采用 LoRA 微调的方法达到了 PSNR 23.22,而完全微调则将指标提升至 25.36。详情见论文 Video Models as Native 4D Renderers

这意味着什么

这条新闻涉及按附加条件生成视频的主题——在我们的指南中,相关章节是 AI Video。DAR 并不是一个新的独立工具,而是一种控制现有模型 Wan2.2 的方法,该模型目前尚未收录在指南中。我们将这种方法与指南中已描述的视频生成器进行比较。 LTX-Video工具页面)解决的是 image-to-video 任务,但其参数表中没有提到对相机或场景几何的控制。开发者未说明该模型是否支持基于网格或轨迹的条件生成——描述中仅声明了基于图像的生成。 CogVideoX工具页面)被定位为 text-to-video 和 image-to-video 生成器。参数表中未注明是否支持输入动画网格或场景几何数据。 Pyramid Flow工具页面)同样是一款 text-to-video 模型,其描述中未提及基于 3D 数据的条件生成。 指南中的任何工具都不提供基于动画网格并控制相机的渲染界面。DAR 表明,视频扩散模型能够胜任此类任务,但实现需要对特定后端进行微调,目前仍是一种研究方法,而非现成的产品。

相关阅读