CPU3DИИ-инструменты для 3D, видео и звука

GlanceWAM разделяет воображение и управление в одном видео DiT для роботов

Исследователи представили GlanceWAM — подход к world-action models, который выносит генерацию видео с критического пути управления. Асинхронный proposer на медленном такте предсказывает один кадр на несколько секунд вперёд в фоне, а action head декодирует действия на частоте управления 48 мс без блокировки. На бенчмарке RoboCasa метод достигает 72.2% успеха, обходя синхронный Cosmos Policy (67.1%) и обучение без воображения (64.4%). Подробности в статье на arXiv.

Что это значит

Новость касается робототехники, а не генераторов видео для пользователей. В нашем разделе генераторов видео прямых аналогов GlanceWAM нет: это не text-to-video и не image-to-video инструмент, а метод управления роботом, где видео используется как внутреннее представление мира. Сравнение с нашими паспортами показывает разницу в задачах. LTX-Video решает image-to-video и работает на потребительском железе от 1 ГБ видеопамяти. CogVideoX — text-to-video, требует CUDA и ориентирован на генерацию по описанию. Pyramid Flow — text-to-video с поддержкой Multi-GPU и CPU offloading. Все три генерируют видео как конечный продукт для человека, тогда как GlanceWAM потребляет видео в латентном пространстве для выбора действий робота. Техническая идея — асинхронная генерация одного кадра вместо синхронного видеопотока — может быть интересна тем, кто следит за снижением задержек в видео-моделях, но в паспортах наших инструментов таких механизмов нет. Разработчики не указывают, применим ли подход вне робототехники.
GlanceWAM: воображение и управление разделены Наблюдение кадр с камеры Proposer асинхронный, медленный такт предсказывает 1 кадр на несколько секунд вперёд работает в фоне Action head декодирует действия частота управления 48 мс без блокировки критический путь Действие команда роботу видео в латентном пространстве Результаты на бенчмарке RoboCasa GlanceWAM 72.2% успеха Cosmos Policy 67.1% синхронный Без воображения 64.4% обучение GlanceWAM — world-action model: видео как внутреннее представление мира для выбора действий робота
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также