CPU3D3D、视频与音频的 AI 工具

Programmable World Model — 用于具有持久状态的可控视频世界的新框架

arXiv 上发表了论文 Programmable World Model,作者在其中提出了一个用于创建交互式视频世界的框架,该世界具有显式的、在帧之间保持的状态。系统不是直接从文本描述生成视频,而是将自然语言指令转换为描述实体及其交互规则的可执行程序。轻量级引擎维护世界的全局状态,包括画面外的对象和非视觉属性。为了将状态与视频生成联系起来,使用了一种中间表示——state-augmented 3D oriented bounding boxes(OBB),它们与相机轨迹一起被编译为预训练视频模型的条件信号。作者还提出了基准 CombatStateBench,在该基准上他们的方法达到了 94% 的对象计数准确率和 98% 的状态准确率。代码已开源。

这意味着什么

这条简讯涉及视频生成这一整体方向——在我们的 AI Video 板块中,汇集了以不同方式解决该任务的工具。Programmable World Model 并不是通常意义上的视频生成器,而是预训练视频模型之上的一个框架:它增加了状态控制层和规则,而视频模型则充当渲染器。在我们的工具页面中没有直接对应的工具。 指南中主题最接近的工具:
  • Lance — Bytedance 的开放 any-to-any 模型,具有 3B 活跃参数,模型权重占用 28.6 GB,最大的文件为 13.2 GB。作者要求配备 40 GB 显存的 GPU 和 CUDA 12.4+。该模型能够理解和生成图像与视频,但参数表中没有持久的世界状态和可编程规则。
  • LTX-Video — Lightricks 的 image-to-video 生成器,模型权重 236.4 GB,代码许可证为 Apache-2.0,模型权重许可证为 other。声称可在 1 GB 显存下运行,并支持 macOS 上的 MPS。这是一个经典的短视频生成器,没有状态机制。
  • CogVideoX(智谱 CogVideoX) — Zhipu AI 的 text-to-video 模型,模型权重 20 GB,代码许可证为 Apache-2.0,模型权重许可证为 other。需要 CUDA,作者提到了 NVIDIA H100。同样不支持持久的世界状态。
Programmable World Model 解决的是我们工具参数表中没有的任务:对实体的显式控制、转换规则以及可见画面之外的状态保持。对于在我们的指南中选择工具的用户来说,这更像是一个发展方向上的信号,而不是一个可用于在自己的硬件上运行的现成工具:作者在论文描述中没有说明显存要求、模型权重大小和许可证。
Programmable World Model — 可控视频世界框架 显式状态、规则,通过预训练视频模型生成 指令 自然语言 程序 实体与规则 轻量引擎 全局状态 OBB 3D 框 + 相机 视频模型 预训练渲染器 条件信号 可控视频 CombatStateBench 精度基准 94% 对象 98% 状态 评估 Lance · LTX-Video · CogVideoX 无持久状态 差异
该方法的构造。示意图根据这条简讯绘制。

相关阅读