arXiv 上发布了一篇论文 Latent evolving World Action Model,作者在其中研究了视觉表示如何影响 World Action Models 中的动作生成。他们表明,来自 JEPA 编码器的预测性嵌入在支持动作生成方面优于压缩的 VAE 潜变量,并提出了 LeWAM——一种不依赖视频扩散后端的模型。代码已开源,详情见
arXiv 上的论文。
这意味着什么
这项工作涉及 world action models 和动作生成方向,而非消费级视频生成器。在我们的
AI 视频指南中,没有 LeWAM 的直接对应物:Maestro、LTX-Video 和 CogVideoX 解决的是 text-to-video 和 image-to-video 任务,而不是智能体动作建模。
尽管如此,从架构上进行比较是合适的。
LTX-Video 和
CogVideoX 使用 diffusion 后端,并通过 diffusers 库运行;LeWAM 则放弃这一点,转而采用 JEPA 嵌入。
Maestro 构建在 WanGP 流水线之上,同样依赖视频扩散。LeWAM 的作者声称,这种做法将性能和训练成本绑定在视频生成器的大规模预训练上——并提出了一种不依赖视频扩散后端的替代方案。
LeWAM 的作者在论文中未说明实际的硬件要求、模型权重体积和许可证,因此目前还无法将其在自己的硬件上运行与指南中的工具进行比较。如果用于动作建模的 JEPA 嵌入方向得到发展,它可能会影响未来视频模型的架构,但对于指南中当前的视频生成器而言,这目前只是研究背景,而非替代品。
该方法的构成。示意图根据本简讯绘制。