arXiv 上发表了论文 Programmable World Model,作者在其中提出了一个用于创建交互式视频世界的框架,该世界具有显式的、在帧之间保持的状态。系统不是直接从文本描述生成视频,而是将自然语言指令转换为描述实体及其交互规则的可执行程序。轻量级引擎维护世界的全局状态,包括画面外的对象和非视觉属性。为了将状态与视频生成联系起来,使用了一种中间表示——state-augmented 3D oriented bounding boxes(OBB),它们与相机轨迹一起被编译为预训练视频模型的条件信号。作者还提出了基准 CombatStateBench,在该基准上他们的方法达到了 94% 的对象计数准确率和 98% 的状态准确率。代码已开源。
这意味着什么
这条简讯涉及视频生成这一整体方向——在我们的 AI Video 板块中,汇集了以不同方式解决该任务的工具。Programmable World Model 并不是通常意义上的视频生成器,而是预训练视频模型之上的一个框架:它增加了状态控制层和规则,而视频模型则充当渲染器。在我们的工具页面中没有直接对应的工具。
指南中主题最接近的工具:
Programmable World Model 解决的是我们工具参数表中没有的任务:对实体的显式控制、转换规则以及可见画面之外的状态保持。对于在我们的指南中选择工具的用户来说,这更像是一个发展方向上的信号,而不是一个可用于在自己的硬件上运行的现成工具:作者在论文描述中没有说明显存要求、模型权重大小和许可证。该方法的构造。示意图根据这条简讯绘制。