Wan2.2 получил метод DAR для рендеринга 4D-сцен по анимированному мешу и камере
Исследователи предложили метод DAR — reference-guided renderer на базе видеодиффузионной модели Wan2.2, который превращает анимированный меш, траекторию камеры и референсное изображение в видео. Вместо карты глубины, где движение камеры и объекта смешаны, DAR использует нейтральный 4D G-буфер из tracking, world position и normal, что позволяет модели точнее разделять анимацию сцены и перемещение камеры. На бенчмарке DAR-4D из 68 сцен LoRA-версия достигает PSNR 23.22, а полный файнтюн — 25.36. Подробности изложены в статье на arXiv.
Что это значит
Новость касается генерации видео по управляющим 3D-сигналам — теме, которую мы отслеживаем в разделе генераторов видео с ИИ. DAR — это метод для Wan2.2, а не самостоятельный инструмент, поэтому напрямую с нашими паспортами он не пересекается. Однако он задаёт направление, в котором могут развиваться открытые генераторы.
У LTX-Video задача — image-to-video, что формально близко к режиму DAR (референсное изображение на входе). Но в паспорте LTX-Video нет упоминаний об управлении камерой или мешем — модель принимает только изображение и текстовый промпт. Для повторения подхода DAR потребовалась бы доработка контрольного адаптера, чего разработчик не заявлял.
CogVideoX и Pyramid Flow решают задачу text-to-video, ещё более далёкую от 4D-рендеринга. Ни один из паспортов не содержит сведений о поддержке анимированной геометрии, траекторий камеры или G-буферов.
Пока DAR остаётся исследовательским методом для конкретной проприетарной модели. Появление аналогичного контрольного интерфейса в открытых генераторах сделало бы их пригодными для задач, где важна точная стыковка 3D-анимации и видео.Как устроен метод. Схема нарисована по этой заметке.