CPU3DИИ-инструменты для 3D, видео и звука

Generative Cinematographer учит видеомодель управлять камерой и объектами в 3D

На arXiv 1 октября 2026 года опубликована работа Generative Cinematographer (GenCine) — система, которая поднимает одно изображение в редактируемую 3D-сцену и позволяет совместно задавать движение камеры и переднего плана. Художник прокладывает путь камеры и двигает выбранные области переднего плана локальными 3D-ручками, которые могут независимо перемещать разные части объекта. Управляющие сигналы проецируются в guidance maps: каждая ручка получает фиксированный цвет, а её 3D-позиции кодируются в мировой системе координат фона, что описывает движение объекта относительно сцены даже при движущейся камере. Авторы обучают лёгкую guidance-ветку и LoRA-адаптеры на предобученной модели Wan. Код авторы не выкладывали. Подробнее — в статье на arXiv.

Что это значит

GenCine строится поверх Wan — открытого генератора видео от Alibaba с задачей text-to-video. Код Wan распространяется по лицензии Apache-2.0, веса — тоже Apache-2.0. Самая крупная модель в репозитории занимает 10.6 ГБ одним файлом, все файлы весов — 64.3 ГБ. Авторы Wan отмечают, что модель T2V-1.3B требует 8.19 ГБ видеопамяти и генерирует пятисекундный ролик 480P на RTX 4090 примерно за четыре минуты без оптимизаций вроде квантизации. В работе GenCine не указаны требования к видеопамяти для обучения guidance-ветки и LoRA-адаптеров, не назван размер дообученной модели и не описаны условия, на которых можно было бы использовать наработки. Код не опубликован, поэтому воспроизвести систему по статье нельзя. Для читателя справочника это означает, что практического инструмента на базе GenCine пока нет, а сравнение с текущими возможностями Wan остаётся на уровне описания метода. Раздел о генераторах видео и других инструментах на своём железе собран на странице AI Video.
Generative Cinematographer (GenCine) Одно изображение — редактируемая 3D-сцена — видео с управляемой камерой Одно изображение входной кадр поднимается в 3D 3D-сцена редактируемая мировая система координат 3D-ручки путь камеры движение переднего плана Guidance maps цвет ручки = сигнал 3D-позиции в мировых координатах Wan + LoRA предобученная модель guidance-ветка LoRA-адаптеры Видео управляемая камера движение объектов Код не опубликован · практического инструмента нет · сравнение с Wan — на уровне описания метода
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также