CPU3D3D、视频与音频的 AI 工具

LeWAM 放弃视频扩散,改用 JEPA 嵌入构建 world action models

arXiv 上发布了一篇论文 Latent evolving World Action Model,作者在其中研究了视觉表示如何影响 World Action Models 中的动作生成。他们表明,来自 JEPA 编码器的预测性嵌入在支持动作生成方面优于压缩的 VAE 潜变量,并提出了 LeWAM——一种不依赖视频扩散后端的模型。代码已开源,详情见 arXiv 上的论文

这意味着什么

这项工作涉及 world action models 和动作生成方向,而非消费级视频生成器。在我们的 AI 视频指南中,没有 LeWAM 的直接对应物:Maestro、LTX-Video 和 CogVideoX 解决的是 text-to-video 和 image-to-video 任务,而不是智能体动作建模。 尽管如此,从架构上进行比较是合适的。LTX-VideoCogVideoX 使用 diffusion 后端,并通过 diffusers 库运行;LeWAM 则放弃这一点,转而采用 JEPA 嵌入。Maestro 构建在 WanGP 流水线之上,同样依赖视频扩散。LeWAM 的作者声称,这种做法将性能和训练成本绑定在视频生成器的大规模预训练上——并提出了一种不依赖视频扩散后端的替代方案。 LeWAM 的作者在论文中未说明实际的硬件要求、模型权重体积和许可证,因此目前还无法将其在自己的硬件上运行与指南中的工具进行比较。如果用于动作建模的 JEPA 嵌入方向得到发展,它可能会影响未来视频模型的架构,但对于指南中当前的视频生成器而言,这目前只是研究背景,而非替代品。
LeWAM:用 JEPA 嵌入替代视频扩散 World Action Models — 生成智能体动作 视频扩散后端 视频 观测帧 text-to-video / image-to-video VAE 潜变量 压缩表示 扩散预训练 规模大、成本高 LeWAM — 不用扩散 观测 智能体状态 视频序列 JEPA 编码器 预测性嵌入 智能体动作 world action model 方法对比 VAE 潜变量 有损压缩 绑定预训练 JEPA 嵌入 更适合动作 无需视频扩散 指南中的同类:Maestro、LTX-Video、CogVideoX(智谱 CogVideoX)— 视频扩散,非动作 LeWAM — 研究性探索,代码开源
该方法的构成。示意图根据本简讯绘制。

相关阅读