CPU3D3D、视频与音频的 AI 工具

PhysStream 推出带物理运动控制的流式视频生成

一组研究人员在 arXiv 上发表了 PhysStream 工作——一种从图像生成视频的自回归模型,它允许在生成过程中直接控制物体运动。模型不使用生成前的完整运动计划或逐像素信号,而是使用编码物理量的稀疏速度增量信号,以及由位置图和物体跟踪图构成的场景结构记忆。详情见 arXiv 上的论文页面。作者未公开代码。

这意味着什么

PhysStream 是一项研究工作,我们的指南中目前还没有采用这种方法的工具。主题最接近的视频生成器来自 AI Video 板块,它们的工作方式不同。 Maestro 是基于 WanGP 管线的本地工作室,任务为 image-text-to-video。MiniMax H3 的模型权重占用 464.1 GB,最大的文件为 9.7 GB,需要 12—24 GB 显存。代码开源,但 WanGP 许可证仅允许该程序本身用于非商业用途;MiniMax H3 的模型权重可在年收入不超过 2000 万美元的情况下用于商业用途,但该许可证在欧盟、英国、韩国和美国不适用。参数表中没有生成中途的交互式运动控制。 LTX-Video 来自 Lightricks,解决 image-to-video 任务,体积为 236.4 GB,最大的文件为 26.6 GB,据称仅需 1 GB 显存。代码采用 Apache-2.0,模型权重采用 LTXV Open Weights License,商业使用门槛为年收入 1000 万美元起。参数表中未提及运动物理控制。 CogVideoX 是 Zhipu AI 的 text-to-video 模型,模型权重为 20 GB,最大的文件为 9.2 GB,可在 CUDA 上运行。代码采用 Apache-2.0,模型权重采用 The CogVideoX License:注册后可商用,每月访问量不超过 100 万次时免费。描述中没有基于物理的运动控制。 PhysStream 被宣称是从文本提示迈向控制场景物理动态的一步,但在没有公开代码和模型权重的情况下,无法在自己的硬件上运行验证。对于带运动控制的本地视频生成,目前仍只有我们 AI Video 板块中的工具,而它们的参数表中并没有这种模式。

相关阅读