CPU3D3D、视频与音频的 AI 工具

4DStreamCtrl 在流式模式下统一控制相机、物体与深度

arXiv 上发布了 4DStreamCtrl 的研究论文——这是一种交互式视频生成方法,它将相机运动、物体轨迹和深度统一为 3D point-track 的单一表示。作者在预训练的视频扩散模型之上训练了一个 Geometric Motion Head,并将其蒸馏为流式学生模型,该模型只需四步去噪即可生成任意长度的视频,且内存占用与视频长度无关。据作者描述,该方法在单块高端 GPU 上以 20 FPS 的速度生成 480p 视频。作者未公开代码——arXiv

这意味着什么

对于我们视频生成器板块中的工具而言,这项工作更多是指明了一个方向,而非提供现成工具:没有代码,没有模型权重,无法根据论文复现该方法。 与我们的参数表对比:
  • LTX-Video — Lightricks 推出的开源 image-to-video 生成器。参数表中既没有相机控制,也没有物体轨迹控制,更没有流式模式。4DStreamCtrl 解决的是 LTX-Video 完全没有的问题。
  • CogVideoX — 智谱 AI 推出的 text-to-video 生成器。参数表中未声明运动控制,也未声明流式生成。与 4DStreamCtrl 没有直接交集。
  • Pyramid Flow — 开源的 text-to-video 生成器。参数表中提到了多 GPU 推理和 CPU 卸载,但没有运动控制,也没有任意长度的流式生成。
目前 4DStreamCtrl 仍是一篇没有公开代码的研究论文,对指南中现有工具没有实际影响。如果作者公开实现,那么内存、速度和运动控制质量的对比才有可能进行——目前缺乏相关数据。
4DStreamCtrl:统一 3D 点跟踪 相机 + 物体 + 深度 — 流式视频 输入信号 相机、物体、 深度 Geometric Motion Head 基于视频扩散 训练 蒸馏 为流式 学生模型 流式学生模型 4 步去噪 显存与视频 长度无关 结果 任意长度 视频 20 FPS, 480p 状态 arXiv,无代码 和权重 无法 复现 尚无公开代码 — 对现有生成器无实际影响
方法的工作原理。示意图根据这篇简讯绘制。

相关阅读