CPU3D3D、视频与音频的 AI 工具

UniMoCa 将人体运动与相机控制统一为单一视觉表示

研究人员介绍了 UniMoCa —— 一种将人体运动和相机轨迹统一转换为名为 Motion-Camera Visual Proxy (MCVP) 的视觉表示的方法。该方法不再向模型输入异构信号(如用于运动的骨骼图、用于相机的数值参数),而是将人体几何和相机运动标记渲染到同一帧中。这使得模型在生成包含复杂动作和动态相机的视频时,能够同时考虑这两个因素。作者还准备了 MCVP-Video 数据集用于训练。

这意味着什么

这条简讯涉及我们 AI-视频 栏目中报道的基于控制信号生成视频的主题。UniMoCa 是一项研究工作,而非现成工具,因此与我们的参数表没有直接交集。 不过可以指出,我们追踪的生成器 —— LTX-VideoCogVideoX(智谱 CogVideoX)Pyramid Flow(快手 Pyramid Flow) —— 均未提供内置功能来分别或联合控制人体运动和相机。这三款工具都只解决基础的 text-to-video 或 image-to-video 任务,没有专门用于逐帧控制角色动画或拍摄轨迹的界面。 UniMoCa 的工作展示了这类界面可能的发展方向,但该功能要出现在公开可用的视频生成器中,还有很长的路要走。
UniMoCa:人体运动与相机的统一视觉表示 输入信号 骨骼 + 相机参数 MCVP 统一视觉代理帧 视频生成器 联合因素建模 输出视频 复杂运动 + 动态相机 MCVP-Video 训练数据集 渲染 输入 生成 训练 问题 异构信号: 骨骼图 + 数值参数 相机 统一化 现有生成器(LTX-Video、CogVideoX(智谱 CogVideoX)、Pyramid Flow(快手 Pyramid Flow))无法分别控制人体运动和相机
方法的工作原理。示意图根据这篇简讯绘制。

相关阅读