CPU3DИИ-инструменты для 3D и видео

SUV: будущее сцены как генерация видео для сквозного вождения

4 августа 2026 года на arXiv появилась работа SUV — фреймворк сквозного вождения, который представляет понимание будущей сцены как задачу генерации видео. Вместо специализированных предсказательных модулей авторы используют предобученную видеомодель, чтобы напрямую генерировать четыре видеопотока: внешний вид, семантику, относительную глубину и динамику объектов. Траектория движения строится через совместное внимание к скрытым представлениям всех этих потоков. На бенчмарке NAVSIM-v2 метод с одной фронтальной камерой и без перебора кандидатов траекторий достиг 91.0 EPDMS на navtest и 36.9 на navhard, а на WOD-E2E показал RFS 7.94. Подробнее на arXiv

Что это значит

SUV не является генератором видео в привычном смысле — это система восприятия и планирования для автопилота, которая внутри себя использует видеогенеративную модель для предсказания будущего. С генераторами видео из нашего раздела AI Video её роднит только архитектурный подход: видеомодель выступает как общий предиктор для нескольких модальностей.

Ни один из инструментов справочника — LTX-Video, CogVideoX или Pyramid Flow — не решает задачу сквозного вождения и не предсказывает семантику или глубину сцены. Это генераторы видео по тексту или изображению, работающие на потребительском оборудовании. SUV же — исследовательский фреймворк для автономного транспорта, требования к оборудованию и доступность кода разработчик не уточняет.

Работа показывает, что видеогенеративные модели могут служить универсальным компонентом для задач, выходящих далеко за пределы развлечения, но практического пересечения с инструментами для создания видео пока нет.

Смотрите также