CPU3D3D、视频与音频的 AI 工具

DeltaWAM 加速双臂机器人动作生成并开源代码

来自 AIGeeksGroup 的研究人员推出了 DeltaWAM——一种用于机器人双手控制的 world-action 模型。它不预测密集的未来帧,而是预测视觉增量和动作,而 Streaming Delta Memory 则通过紧凑的变更来更新缓存的上下文。在 RoboTwin 基准测试中,纯环境下的平均成功率从 81.3% 提升到 85.4%,视觉随机化条件下从 75.8% 提升到 83.9%。单步推理延迟降低了 36.57%,FLOPs 降低了 31.55%。代码已开源,详情见 arXiv 上的论文。

这意味着什么

DeltaWAM 不是面向用户的视频生成器,而是一种机器人控制模型,它将视频生成器用作视觉和运动先验的来源。在我们的AI 视频工具栏目中没有它的直接对应物:Maestro、LTX-Video 和 CogVideoX(智谱 CogVideoX)解决的是 image-text-to-video、image-to-video 和 text-to-video 任务,而不是动作生成。 尽管如此,在架构层面仍有交集。指南中的这三款工具都基于扩散视频模型,而 DeltaWAM 的理念——不生成完整帧,只预测变化——在概念上接近轻量视频生成器已经在做的事情。例如,LTX-Video 声称仅需 1 GB 显存,而 Maestro 可在 12 GB 及以上的显卡上运行。DeltaWAM 走得更远:它在每一步根本不使用重型视频专家来处理完整观测,而只更新增量。 DeltaWAM 的作者没有说明代码和模型权重的许可证、显存要求和运行平台。从论文来看,该模型是在机器人基准测试上训练和测试的,而不是在用户 GPU 上,因此目前还无法将其系统要求与指南中的视频生成器进行比较。 对于关注本地视频模型的人来说,DeltaWAM 的价值在于它展示了推理优化的方向:减少每步计算量、缓存上下文,以及放弃对未变化内容的重复处理。如果这些方法迁移到用户级视频生成器中,它们可能会降低显存要求,并加速在本地硬件上的生成。
DeltaWAM:双臂机器人 world-action 模型 观测 双手画面 与机器人状态 Streaming Delta Memory 上下文缓存 增量更新 视觉增量 仅变化部分 而非完整帧 动作 双机械臂 指令 RoboTwin 结果: 成功率:81.3% — 85.4%(纯环境) 75.8% — 83.9%(随机化) 延迟:-36.57% FLOPs: -31,55% 迭代循环 视频生成器: Maestro, LTX-Video, CogVideoX(智谱 CogVideoX)— 完整 帧,而非动作 架构上的 相近性
该方法的构造。示意图根据本简讯绘制。

相关阅读