研究人员在
arXiv上发布了 Robust-WAM——一种针对基于视频生成模型构建的 World-Action Models 的后训练方法。这项研究要解决的核心问题是:标准视频生成器在针对逐像素重建优化的 VAE 空间中运行,导致在光照变化和其他视觉偏移下,机器人动作预测变得脆弱。作者提出添加一种轻量级的语义调整,既保留视频生成器大规模预训练的优势,又通过将隐藏状态与未来帧的语义对齐,将动作绑定到对外观不变的特性上。
这意味着什么
Robust-WAM 并非面向最终用户的新视频生成器——它是一种面向机器人技术的研究方法,构建在现有视频生成模型之上。它不会直接影响
AI 视频指南中的工具。
我们的指南收录了面向创意任务的视频生成器:
LTX-Video 解决 image-to-video 任务,
CogVideoX(智谱 CogVideoX) 和
Pyramid Flow(快手 Pyramid Flow) 解决 text-to-video 任务。它们都使用论文中提到的 VAE 潜在空间,但它们的任务是生成视觉上高质量的视频,而不是预测机器人的动作。Robust-WAM 所解决的视觉偏移鲁棒性问题,对这些工具来说并非优先事项——恰恰相反,它们的 VAE 正是为了精确还原外观而优化的。
Robust-WAM 方法可能对基于视频生成器构建控制系统的开发者有吸引力,但对创意 AI 工具的用户来说,不会带来实际变化。
方法的工作原理。示意图根据这篇简讯绘制。