CPU3DИИ-инструменты для 3D и видео

Robust-WAM добавляет семантическую устойчивость в World-Action Models на базе видеогенераторов

Исследователи из arXiv представили Robust-WAM — метод пост-тренировки для World-Action Models, построенных на основе видеогенеративных моделей. Основная проблема, которую решает работа: стандартные видеогенераторы работают в VAE-пространстве, оптимизированном под попиксельное восстановление, из-за чего предсказание действий робота становится хрупким при смене освещения и других визуальных сдвигах. Авторы предлагают добавлять лёгкую семантическую настройку, которая сохраняет преимущества крупномасштабного предобучения видеогенераторов, но привязывает действия к инвариантным к внешности признакам через выравнивание скрытых состояний с семантикой будущих кадров.

Что это значит

Работа Robust-WAM не является новым генератором видео для конечного пользователя — это исследовательский метод для робототехники, который надстраивается над существующими видеогенеративными моделями. Прямого влияния на инструменты из справочника AI-видео он не оказывает. В нашем справочнике представлены генераторы видео для творческих задач: LTX-Video решает задачу image-to-video, CogVideoX и Pyramid Flow — text-to-video. Все они используют VAE-латентное пространство, о котором идёт речь в статье, но их задача — генерация визуально качественных роликов, а не предсказание действий для роботов. Проблема устойчивости к визуальным сдвигам, которую решает Robust-WAM, для этих инструментов не является приоритетной — напротив, их VAE оптимизированы именно под точную передачу внешнего вида. Метод Robust-WAM может быть интересен разработчикам, которые строят системы управления на базе видеогенераторов, но для пользователей творческих AI-инструментов практических изменений не несёт.
Robust-WAM: семантическая устойчивость в World-Action Models Видеогенератор VAE-латентное пространство попиксельное восст. Визуальные сдвиги Смена освещения Изменение фона хрупкость действий Robust-WAM Семантическая настройка пост-тренировка над видеогенератором Выравнивание Скрытые состояния — семантика будущих кадров Инвариантные признаки Устойчивость к внешним изменениям Действия робота Устойчивое предсказание при любом освещении Предобучение Крупномасштабное сохраняется преимущества Метод пост-тренировки для World-Action Models на базе видеогенераторов Семантическая настройка поверх VAE-латентного пространства
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также