CPU3D3D、视频与音频的 AI 工具

Latent-to-4D 直接从视频潜变量生成4D场景,无需中间RGB步骤

作者在论文 Beyond Pixels: From Video Priors to 4D Worlds 中提出了 Latent-to-4D 方法,该方法跳过了 RGB 视频重建阶段,直接从视频模型的最终去噪潜变量中预测动态 3D 场景。该方法的依据是,同一家族的视频生成器共享一个 VAE,因此潜空间可以用作可移植的接口。一个在大约一千个片段上训练的检查点,可以在同一 VAE 家族内的不同视频扩散 Transformer 之间无需修改地迁移。作者未公开代码。

这意味着什么

这项工作涉及“视频生成器 — 4D 场景”的组合,即我们指南中属于 AI 视频与 3D 部分的范畴。在我们描述的工具中,主题最接近的是 Wan(通义万相):这是阿里巴巴推出的开源视频生成器,任务为 text-to-video,代码和权重在 Apache-2.0 许可下可用,模型通过 diffusers 运行。 在 Wan 的参数表中,没有关于它能够将中间潜变量输出用于 4D 重建等下游任务的信息。Latent-to-4D 的作者在对比“视频 + 4D 重建器”级联时提到了 Wan,但这是在他们自己的基准测试框架内的比较,并非声称与 Wan 本身的集成。Wan 的开发者并未描述这样的使用场景。 对用户而言,目前实际影响不大:没有代码,检查点未发布,而且该方法本身依赖于特定 VAE 家族的潜变量访问。对于使用 Wan 的人来说,这更多是视频与 4D 结合可能发展方向的一个信号,而非现成工具。
Latent-to-4D:从视频潜变量直接到 4D 场景 视频生成器 Video diffusion transformer 同一 VAE 家族 去噪潜变量 最终视频潜变量 可迁移接口 RGB 视频 中间阶段 被跳过 Latent-to-4D 单个检查点 约一千个片段 4D 场景 动态 3D 无需 RGB 重建 检查点可在不同 video diffusion transformers 间无改动迁移 同一 VAE 家族内 · 代码和权重未公开
方法的工作原理。示意图根据这篇简讯绘制。

相关阅读