LeWAM отказывается от видеодиффузии в пользу JEPA-эмбеддингов для world action models
На arXiv опубликована работа Latent evolving World Action Model, в которой авторы исследуют, как визуальные представления влияют на генерацию действий в World Action Models. Они показывают, что предиктивные эмбеддинги от JEPA-энкодеров поддерживают генерацию действий лучше, чем сжатые VAE-латенты, и предлагают LeWAM — модель, которая не опирается на видеодиффузионный бэкбон. Код выложен в открытый доступ, подробности — в статье на arXiv.
Что это значит
Работа касается направления world action models и генерации действий, а не потребительских генераторов видео. В нашем справочнике по ИИ для видео прямых аналогов LeWAM нет: Maestro, LTX-Video и CogVideoX решают задачи text-to-video и image-to-video, а не моделирование действий агента.
Тем не менее сравнение по архитектуре уместно. LTX-Video и CogVideoX используют diffusion-бэкбоны и работают через библиотеку diffusers; LeWAM от этого отказывается в пользу JEPA-эмбеддингов. Maestro построен на пайплайне WanGP и тоже опирается на видеодиффузию. Авторы LeWAM утверждают, что такой подход привязывает производительность и стоимость обучения к масштабному претрейну видеогенераторов — и предлагают альтернативу без видеодиффузионного бэкбона.
Практических требований к железу, объёма весов и лицензии авторы LeWAM в статье не указывают, поэтому сравнить запуск на локальной машине с инструментами из справочника пока нельзя. Если направление JEPA-эмбеддингов для моделирования действий получит развитие, оно может повлиять на архитектуры будущих видеомоделей, но для текущих генераторов видео в справочнике это пока исследовательский контекст, а не замена.Как устроен метод. Схема нарисована по этой заметке.