4DStreamCtrl 在流式模式下统一控制相机、物体与深度
arXiv 上发布了 4DStreamCtrl 的研究论文——这是一种交互式视频生成方法,它将相机运动、物体轨迹和深度统一为 3D point-track 的单一表示。作者在预训练的视频扩散模型之上训练了一个 Geometric Motion Head,并将其蒸馏为流式学生模型,该模型只需四步去噪即可生成任意长度的视频,且内存占用与视频长度无关。据作者描述,该方法在单块高端 GPU 上以 20 FPS 的速度生成 480p 视频。作者未公开代码——arXiv。
方法的工作原理。示意图根据这篇简讯绘制。
这意味着什么
对于我们视频生成器板块中的工具而言,这项工作更多是指明了一个方向,而非提供现成工具:没有代码,没有模型权重,无法根据论文复现该方法。 与我们的参数表对比:- LTX-Video — Lightricks 推出的开源 image-to-video 生成器。参数表中既没有相机控制,也没有物体轨迹控制,更没有流式模式。4DStreamCtrl 解决的是 LTX-Video 完全没有的问题。
- CogVideoX — 智谱 AI 推出的 text-to-video 生成器。参数表中未声明运动控制,也未声明流式生成。与 4DStreamCtrl 没有直接交集。
- Pyramid Flow — 开源的 text-to-video 生成器。参数表中提到了多 GPU 推理和 CPU 卸载,但没有运动控制,也没有任意长度的流式生成。



