研究人员提出了 GlanceWAM——一种 world-action models 方法,将视频生成移出控制的关键路径。异步 proposer 以慢节奏在后台提前几秒预测一帧,而 action head 以 48 毫秒的控制频率解码动作,无需阻塞。在 RoboCasa 基准测试中,该方法达到 72.2% 的成功率,优于同步的 Cosmos Policy(67.1%)和无想象力的训练(64.4%)。详情见
arXiv 上的文章。
这意味着什么
这条新闻涉及机器人技术,而非面向用户的视频生成器。在我们的
视频生成器板块中,没有与 GlanceWAM 直接对应的工具:它不是 text-to-video 或 image-to-video 工具,而是一种机器人控制方法,其中视频被用作世界的内部表示。
与我们的参数表对比可以看出任务上的差异。
LTX-Video 解决 image-to-video 问题,可在消费级硬件上运行,显存需求从 1 GB 起。
CogVideoX(智谱 CogVideoX)是 text-to-video,需要 CUDA,专注于按描述生成。
Pyramid Flow(快手 Pyramid Flow)是 text-to-video,支持 Multi-GPU 和 CPU offloading。这三者都将视频作为面向人的最终产品生成,而 GlanceWAM 则在潜在空间中消费视频以选择机器人的动作。
技术思路——异步生成单帧而非同步视频流——可能对关注视频模型延迟降低的人感兴趣,但在我们工具的参数表中没有此类机制。开发者未说明该方法是否适用于机器人技术之外。
方法的工作原理。示意图根据这篇简讯绘制。