CPU3D3D、视频与音频的 AI 工具

GlanceWAM 在面向机器人的单一视频 DiT 中分离想象与控制

研究人员提出了 GlanceWAM——一种 world-action models 方法,将视频生成移出控制的关键路径。异步 proposer 以慢节奏在后台提前几秒预测一帧,而 action head 以 48 毫秒的控制频率解码动作,无需阻塞。在 RoboCasa 基准测试中,该方法达到 72.2% 的成功率,优于同步的 Cosmos Policy(67.1%)和无想象力的训练(64.4%)。详情见 arXiv 上的文章

这意味着什么

这条新闻涉及机器人技术,而非面向用户的视频生成器。在我们的视频生成器板块中,没有与 GlanceWAM 直接对应的工具:它不是 text-to-video 或 image-to-video 工具,而是一种机器人控制方法,其中视频被用作世界的内部表示。 与我们的参数表对比可以看出任务上的差异。LTX-Video 解决 image-to-video 问题,可在消费级硬件上运行,显存需求从 1 GB 起。CogVideoX(智谱 CogVideoX)是 text-to-video,需要 CUDA,专注于按描述生成。Pyramid Flow(快手 Pyramid Flow)是 text-to-video,支持 Multi-GPU 和 CPU offloading。这三者都将视频作为面向人的最终产品生成,而 GlanceWAM 则在潜在空间中消费视频以选择机器人的动作。 技术思路——异步生成单帧而非同步视频流——可能对关注视频模型延迟降低的人感兴趣,但在我们工具的参数表中没有此类机制。开发者未说明该方法是否适用于机器人技术之外。
GlanceWAM:想象与控制分离 观察 摄像头画面 Proposer 异步,慢时钟 预测1帧 提前数秒 后台运行 Action head 解码动作 控制频率48毫秒 无阻塞 关键路径 动作 机器人指令 潜空间视频 RoboCasa基准测试结果 GlanceWAM 72.2% 成功率 Cosmos Policy 67.1% 同步 无想象 64.4% 训练 GlanceWAM — 世界动作模型:视频作为内部世界表征以选择机器人动作
方法的工作原理。示意图根据这篇简讯绘制。

相关阅读