GlanceWAM разделяет воображение и управление в одном видео DiT для роботов
Исследователи представили GlanceWAM — подход к world-action models, который выносит генерацию видео с критического пути управления. Асинхронный proposer на медленном такте предсказывает один кадр на несколько секунд вперёд в фоне, а action head декодирует действия на частоте управления 48 мс без блокировки. На бенчмарке RoboCasa метод достигает 72.2% успеха, обходя синхронный Cosmos Policy (67.1%) и обучение без воображения (64.4%). Подробности в статье на arXiv.
Что это значит
Новость касается робототехники, а не генераторов видео для пользователей. В нашем разделе генераторов видео прямых аналогов GlanceWAM нет: это не text-to-video и не image-to-video инструмент, а метод управления роботом, где видео используется как внутреннее представление мира.
Сравнение с нашими паспортами показывает разницу в задачах. LTX-Video решает image-to-video и работает на потребительском железе от 1 ГБ видеопамяти. CogVideoX — text-to-video, требует CUDA и ориентирован на генерацию по описанию. Pyramid Flow — text-to-video с поддержкой Multi-GPU и CPU offloading. Все три генерируют видео как конечный продукт для человека, тогда как GlanceWAM потребляет видео в латентном пространстве для выбора действий робота.
Техническая идея — асинхронная генерация одного кадра вместо синхронного видеопотока — может быть интересна тем, кто следит за снижением задержек в видео-моделях, но в паспортах наших инструментов таких механизмов нет. Разработчики не указывают, применим ли подход вне робототехники.Как устроен метод. Схема нарисована по этой заметке.