CPU3DИИ-инструменты для 3D и видео

Wan2.2 получил метод DAR для рендеринга 4D-сцен по анимированному мешу и камере

Исследователи предложили метод DAR — reference-guided renderer на базе видеодиффузионной модели Wan2.2, который превращает анимированный меш, траекторию камеры и референсное изображение в видео. Вместо карты глубины, где движение камеры и объекта смешаны, DAR использует нейтральный 4D G-буфер из tracking, world position и normal, что позволяет модели точнее разделять анимацию сцены и перемещение камеры. На бенчмарке DAR-4D из 68 сцен LoRA-версия достигает PSNR 23.22, а полный файнтюн — 25.36. Подробности изложены в статье на arXiv.

Что это значит

Новость касается генерации видео по управляющим 3D-сигналам — теме, которую мы отслеживаем в разделе генераторов видео с ИИ. DAR — это метод для Wan2.2, а не самостоятельный инструмент, поэтому напрямую с нашими паспортами он не пересекается. Однако он задаёт направление, в котором могут развиваться открытые генераторы. У LTX-Video задача — image-to-video, что формально близко к режиму DAR (референсное изображение на входе). Но в паспорте LTX-Video нет упоминаний об управлении камерой или мешем — модель принимает только изображение и текстовый промпт. Для повторения подхода DAR потребовалась бы доработка контрольного адаптера, чего разработчик не заявлял. CogVideoX и Pyramid Flow решают задачу text-to-video, ещё более далёкую от 4D-рендеринга. Ни один из паспортов не содержит сведений о поддержке анимированной геометрии, траекторий камеры или G-буферов. Пока DAR остаётся исследовательским методом для конкретной проприетарной модели. Появление аналогичного контрольного интерфейса в открытых генераторах сделало бы их пригодными для задач, где важна точная стыковка 3D-анимации и видео.
Метод DAR для Wan2.2 — 4D-рендеринг по мешу и камере Входные данные Анимированный меш, траектория камеры, референсное изображение tracking world pos normal Нейтральный 4D G-буфер Разделение анимации и движения камеры Wan2.2 + DAR Видеодиффузионная модель-рендерер Видео 4D-сцена Результаты на бенчмарке DAR-4D (68 сцен) PSNR 23.22 LoRA-версия PSNR 25.36 Полный файнтюн Открытые аналоги: отсутствие поддержки 3D-управления LTX-Video Только image-to-video CogVideoX Только text-to-video Pyramid Flow Только text-to-video Нет поддержки меша, камеры и G-буферов
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также