CPU3DИИ-инструменты для 3D, видео и звука

DeltaWAM ускоряет генерацию действий для бимануальных роботов и выкладывает код

Исследователи из AIGeeksGroup представили DeltaWAM — модель world-action для управления двумя руками робота. Вместо предсказания плотных будущих кадров она предсказывает визуальные дельты и действия, а Streaming Delta Memory обновляет кэшированный контекст компактными изменениями. На бенчмарке RoboTwin средний успех вырос с 81,3% до 85,4% в чистой среде и с 75,8% до 83,9% при визуальной рандомизации. Задержка одношагового инференса снизилась на 36,57%, FLOPs — на 31,55%. Код открыт, подробности — в статье на arXiv.

Что это значит

DeltaWAM — это не генератор видео для пользователя, а модель управления роботом, которая использует видеогенераторы как источник визуальных и моторных приоров. В нашем разделе об ИИ-инструментах для видео прямых аналогов ей нет: Maestro, LTX-Video и CogVideoX решают задачи image-text-to-video, image-to-video и text-to-video, а не генерацию действий. Тем не менее пересечение есть на уровне архитектуры. Все три инструмента из справочника построены на диффузионных видеомоделях, и идея DeltaWAM — не генерировать полные кадры, а предсказывать только изменения — концептуально близка тому, что уже делают лёгкие видеогенераторы. Например, LTX-Video заявляет потребность всего в 1 ГБ видеопамяти, а Maestro работает на картах от 12 ГБ. DeltaWAM идёт дальше: она вообще не обрабатывает полные наблюдения тяжёлым видеоэкспертом на каждом шаге, а обновляет только дельты. Авторы DeltaWAM не указывают лицензию кода и весов, требования к видеопамяти и платформу запуска. Судя по статье, модель обучалась и тестировалась на робототехнических бенчмарках, а не на пользовательских GPU, поэтому сравнивать её системные требования с видеогенераторами из справочника пока не с чем. Для тех, кто следит за локальными видеомоделями, DeltaWAM интересна как пример того, куда движется оптимизация инференса: меньше вычислений на шаг, кэширование контекста и отказ от повторной обработки неизменного содержимого. Если эти приёмы перейдут в пользовательские генераторы видео, они могут снизить требования к видеопамяти и ускорить генерацию на локальном железе.
DeltaWAM: модель world-action для бимануальных роботов Наблюдения кадры с двух рук и состояние робота Streaming Delta Memory кэш контекста обновление дельтами Визуальные дельты только изменения вместо полных кадров Действия команды для двух манипуляторов Результаты на RoboTwin: Успех: 81,3% — 85,4% (чистая среда) 75,8% — 83,9% (рандомизация) Задержка: -36,57% FLOPs: -31,55% итеративный цикл Видеогенераторы: Maestro, LTX-Video, CogVideoX — полные кадры, не действия архитектурная близость
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также