CPU3DИИ-инструменты для 3D и видео

Wan2.2 научили рендерить видео по анимированному мешу с помощью метода DAR

Исследователи представили метод DAR, который превращает предобученную видеомодель Wan2.2 в рендерер, управляемый анимированным мешем, траекторией камеры и референсным изображением. Вместо карты глубины, где движение камеры и объектов смешано, DAR использует пару tracking и world position — это позволяет модели точнее разделять анимацию сцены и перемещение камеры. На бенчмарке DAR-4D из 68 сцен метод с дообучением LoRA достиг PSNR 23.22, а полный файнтюнинг поднял показатель до 25.36. Подробности изложены в статье Video Models as Native 4D Renderers.

Что это значит

Новость касается темы генерации видео по дополнительным условиям — в нашем справочнике ей посвящён раздел AI Video. DAR — это не новый самостоятельный инструмент, а метод управления существующей моделью Wan2.2, которой в справочнике пока нет. Сравним подход с теми генераторами видео, что у нас описаны. LTX-Video (карточка) решает задачу image-to-video, но в паспорте нет упоминаний об управлении камерой или геометрией сцены. Разработчик не уточняет, поддерживает ли модель conditioned generation по мешу или траектории — в описании заявлена только генерация по изображению. CogVideoX (карточка) заявлен как text-to-video и image-to-video генератор. Возможность подать на вход анимированный меш или данные о геометрии сцены в паспорте не указана. Pyramid Flow (карточка) — также text-to-video модель, в описании которой conditioned generation по 3D-данным не упоминается. Ни один из инструментов справочника не предлагает интерфейса для рендеринга по анимированному мешу с контролем камеры. DAR показывает, что видеодиффузионные модели способны на такую задачу, но реализация требует дообучения под конкретный бэкбон и пока остаётся исследовательским методом, а не готовым продуктом.

Смотрите также