CPU3DИИ-инструменты для 3D, видео и звука

LeWAM отказывается от видеодиффузии в пользу JEPA-эмбеддингов для world action models

На arXiv опубликована работа Latent evolving World Action Model, в которой авторы исследуют, как визуальные представления влияют на генерацию действий в World Action Models. Они показывают, что предиктивные эмбеддинги от JEPA-энкодеров поддерживают генерацию действий лучше, чем сжатые VAE-латенты, и предлагают LeWAM — модель, которая не опирается на видеодиффузионный бэкбон. Код выложен в открытый доступ, подробности — в статье на arXiv.

Что это значит

Работа касается направления world action models и генерации действий, а не потребительских генераторов видео. В нашем справочнике по ИИ для видео прямых аналогов LeWAM нет: Maestro, LTX-Video и CogVideoX решают задачи text-to-video и image-to-video, а не моделирование действий агента. Тем не менее сравнение по архитектуре уместно. LTX-Video и CogVideoX используют diffusion-бэкбоны и работают через библиотеку diffusers; LeWAM от этого отказывается в пользу JEPA-эмбеддингов. Maestro построен на пайплайне WanGP и тоже опирается на видеодиффузию. Авторы LeWAM утверждают, что такой подход привязывает производительность и стоимость обучения к масштабному претрейну видеогенераторов — и предлагают альтернативу без видеодиффузионного бэкбона. Практических требований к железу, объёма весов и лицензии авторы LeWAM в статье не указывают, поэтому сравнить запуск на локальной машине с инструментами из справочника пока нельзя. Если направление JEPA-эмбеддингов для моделирования действий получит развитие, оно может повлиять на архитектуры будущих видеомоделей, но для текущих генераторов видео в справочнике это пока исследовательский контекст, а не замена.
LeWAM: JEPA-эмбеддинги вместо видеодиффузии World Action Models — генерация действий агента Видеодиффузионный бэкбон Видео кадры наблюдений text-to-video / image-to-video VAE-латенты сжатые представления Диффузионный претрейн масштабный, дорогой LeWAM — без диффузии Наблюдения состояние агента видеоряд JEPA-энкодер предиктивные эмбеддинги Действия агента world action model Сравнение подходов VAE-латенты сжатие с потерями привязка к претрейну JEPA-эмбеддинги лучше для действий без видеодиффузии Аналоги в справочнике: Maestro, LTX-Video, CogVideoX — видеодиффузия, не действия LeWAM — исследовательский контекст, код открыт
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также