CPU3D3D、视频与音频的 AI 工具

FlowHMR 将视频动作捕捉转化为带物理控制的生成任务

arXiv 上发表了 FlowHMR 的研究——一种从单目视频中恢复人体全局 3D 运动的方法。作者将任务表述为以视频为条件的运动生成,并首先预训练了一个 flow matching 模型。随后,他们使用 Group Relative Policy Optimization(GRPO)对模型进行微调,并采用两种奖励:fidelity reward 负责与原始视频的一致性,而 tracking reward 则负责物理控制器能够成功跟踪生成运动的程度。据作者称,这种方法能够避免直接回归所特有的平均化解决方案,并使结果在物理上合理。为了评估,作者提出了 Wild-4K 数据集,包含约 4 千个互联网视频。详情见 arXiv 上的论文。

这意味着什么

FlowHMR 解决的是动作捕捉任务,而不是视频生成,因此它不会与我们视频生成器分类中的工具直接交叉。不过,还是值得看看它与指南中已有的内容有何关联。 Maestro 是一个基于 WanGP 流水线的本地视频、图像和音乐生成工作室。它的任务是 image-text-to-video,而不是从现成视频中恢复人体运动。代码开源,但 WanGP Non-Commercial Evaluation License 1.1 许可证仅允许该程序本身用于非商业用途;MiniMax H3 的模型权重可在年收入不超过 2000 万美元的情况下用于商业用途,但该许可证在欧盟、英国、韩国和美国不适用。需要 12—24 GB 显存。Maestro 的参数表中没有任何物理控制器或动作捕捉模块。 Lightricks 的 LTX-Video 是一个采用 Apache-2.0 开源许可证的 image-to-video 生成器。模型权重按 LTXV Open Weights License 0.X 分发:允许商业使用,但年收入达到 1000 万美元及以上的公司需要单独获得许可证。作者声称该模型仅需 1 GB 显存。这同样是一个生成模型,而不是动作捕捉工具,其参数表中也没有声明结果的物理合理性。 智谱 AI 的 CogVideoX 解决的是 text-to-video 任务。代码以 Apache-2.0 开源,模型权重采用 The CogVideoX License:学术用途免费,商业用途需要注册,每月访问量不超过 100 万次时免费。最大的模型权重文件为 9.2 GB。与前几种情况一样,这是一个视频生成器,而不是运动恢复系统,在任务上与 FlowHMR 没有交叉。 FlowHMR 的有趣之处在于,它将重点从回归精度转移到结果的物理可跟踪性上。对于寻找人体运动处理工具的用户来说,这更像是一个研究方向上的信号,而不是一个现成的工具:在我们的指南中,目前还没有任务上的同类工具。
FlowHMR:从视频到物理可追踪的3D运动 视频 单目片段 含人物 Flow Matching 预训练 运动生成 GRPO 微调 两项奖励 3D姿态 运动 两项GRPO奖励 Fidelity reward 一致性 与源视频 Tracking reward 追踪成功率 物理控制器 与直接回归的区别 直接回归:平均解 无物理控制 FlowHMR:物理合理 可追踪运动 Wild-4K 约4千
该方法的结构。示意图根据本简讯绘制。

相关阅读