来自 AIGeeksGroup 的研究人员推出了 DeltaWAM——一种用于机器人双手控制的 world-action 模型。它不预测密集的未来帧,而是预测视觉增量和动作,而 Streaming Delta Memory 则通过紧凑的变更来更新缓存的上下文。在 RoboTwin 基准测试中,纯环境下的平均成功率从 81.3% 提升到 85.4%,视觉随机化条件下从 75.8% 提升到 83.9%。单步推理延迟降低了 36.57%,FLOPs 降低了 31.55%。代码已开源,详情见
arXiv 上的论文。
这意味着什么
DeltaWAM 不是面向用户的视频生成器,而是一种机器人控制模型,它将视频生成器用作视觉和运动先验的来源。在我们的
AI 视频工具栏目中没有它的直接对应物:
Maestro、
LTX-Video 和
CogVideoX(智谱 CogVideoX)解决的是 image-text-to-video、image-to-video 和 text-to-video 任务,而不是动作生成。
尽管如此,在架构层面仍有交集。指南中的这三款工具都基于扩散视频模型,而 DeltaWAM 的理念——不生成完整帧,只预测变化——在概念上接近轻量视频生成器已经在做的事情。例如,LTX-Video 声称仅需 1 GB 显存,而 Maestro 可在 12 GB 及以上的显卡上运行。DeltaWAM 走得更远:它在每一步根本不使用重型视频专家来处理完整观测,而只更新增量。
DeltaWAM 的作者没有说明代码和模型权重的许可证、显存要求和运行平台。从论文来看,该模型是在机器人基准测试上训练和测试的,而不是在用户 GPU 上,因此目前还无法将其系统要求与指南中的视频生成器进行比较。
对于关注本地视频模型的人来说,DeltaWAM 的价值在于它展示了推理优化的方向:减少每步计算量、缓存上下文,以及放弃对未变化内容的重复处理。如果这些方法迁移到用户级视频生成器中,它们可能会降低显存要求,并加速在本地硬件上的生成。
该方法的构造。示意图根据本简讯绘制。