研究人员介绍了
UniMoCa —— 一种将人体运动和相机轨迹统一转换为名为 Motion-Camera Visual Proxy (MCVP) 的视觉表示的方法。该方法不再向模型输入异构信号(如用于运动的骨骼图、用于相机的数值参数),而是将人体几何和相机运动标记渲染到同一帧中。这使得模型在生成包含复杂动作和动态相机的视频时,能够同时考虑这两个因素。作者还准备了 MCVP-Video 数据集用于训练。
这意味着什么
这条简讯涉及我们
AI-视频 栏目中报道的基于控制信号生成视频的主题。UniMoCa 是一项研究工作,而非现成工具,因此与我们的参数表没有直接交集。
不过可以指出,我们追踪的生成器 ——
LTX-Video、
CogVideoX(智谱 CogVideoX) 或
Pyramid Flow(快手 Pyramid Flow) —— 均未提供内置功能来分别或联合控制人体运动和相机。这三款工具都只解决基础的 text-to-video 或 image-to-video 任务,没有专门用于逐帧控制角色动画或拍摄轨迹的界面。
UniMoCa 的工作展示了这类界面可能的发展方向,但该功能要出现在公开可用的视频生成器中,还有很长的路要走。
方法的工作原理。示意图根据这篇简讯绘制。