Исследователи представили
UniMoCa — метод, который переводит и движение человека, и траекторию камеры в общее визуальное представление под названием Motion-Camera Visual Proxy (MCVP). Вместо того чтобы подавать в модель разнородные сигналы — скелетные карты для движения и числовые параметры для камеры, — MCVP рендерит геометрию человека и маркеры движения камеры в одном кадре. Это позволяет модели совместно учитывать оба фактора при генерации видео со сложными движениями и динамичной камерой. Авторы также подготовили набор данных MCVP-Video для обучения.
Что это значит
Новость затрагивает тему генерации видео по управляющим сигналам, которую мы освещаем в разделе
AI-видео. UniMoCa — это исследовательская работа, а не готовый инструмент, поэтому напрямую с нашими паспортами она не пересекается.
Тем не менее, можно отметить, что ни один из отслеживаемых нами генераторов —
LTX-Video,
CogVideoX или
Pyramid Flow — не предлагает встроенных средств для раздельного или совместного контроля движений человека и камеры. Все три инструмента решают базовые задачи text-to-video или image-to-video без специализированных интерфейсов для покадрового управления анимацией персонажей или траекторией съёмки.
Работа UniMoCa показывает возможное направление развития таких интерфейсов, но до появления этой функциональности в публично доступных генераторах видео пока далеко.