arXiv 上发表了 FlowHMR 的研究——一种从单目视频中恢复人体全局 3D 运动的方法。作者将任务表述为以视频为条件的运动生成,并首先预训练了一个 flow matching 模型。随后,他们使用 Group Relative Policy Optimization(GRPO)对模型进行微调,并采用两种奖励:fidelity reward 负责与原始视频的一致性,而 tracking reward 则负责物理控制器能够成功跟踪生成运动的程度。据作者称,这种方法能够避免直接回归所特有的平均化解决方案,并使结果在物理上合理。为了评估,作者提出了 Wild-4K 数据集,包含约 4 千个互联网视频。详情见
arXiv 上的论文。
这意味着什么
FlowHMR 解决的是动作捕捉任务,而不是视频生成,因此它不会与我们
视频生成器分类中的工具直接交叉。不过,还是值得看看它与指南中已有的内容有何关联。
Maestro 是一个基于 WanGP 流水线的本地视频、图像和音乐生成工作室。它的任务是 image-text-to-video,而不是从现成视频中恢复人体运动。代码开源,但 WanGP Non-Commercial Evaluation License 1.1 许可证仅允许该程序本身用于非商业用途;MiniMax H3 的模型权重可在年收入不超过 2000 万美元的情况下用于商业用途,但该许可证在欧盟、英国、韩国和美国不适用。需要 12—24 GB 显存。Maestro 的参数表中没有任何物理控制器或动作捕捉模块。
Lightricks 的
LTX-Video 是一个采用 Apache-2.0 开源许可证的 image-to-video 生成器。模型权重按 LTXV Open Weights License 0.X 分发:允许商业使用,但年收入达到 1000 万美元及以上的公司需要单独获得许可证。作者声称该模型仅需 1 GB 显存。这同样是一个生成模型,而不是动作捕捉工具,其参数表中也没有声明结果的物理合理性。
智谱 AI 的
CogVideoX 解决的是 text-to-video 任务。代码以 Apache-2.0 开源,模型权重采用 The CogVideoX License:学术用途免费,商业用途需要注册,每月访问量不超过 100 万次时免费。最大的模型权重文件为 9.2 GB。与前几种情况一样,这是一个视频生成器,而不是运动恢复系统,在任务上与 FlowHMR 没有交叉。
FlowHMR 的有趣之处在于,它将重点从回归精度转移到结果的物理可跟踪性上。对于寻找人体运动处理工具的用户来说,这更像是一个研究方向上的信号,而不是一个现成的工具:在我们的指南中,目前还没有任务上的同类工具。
该方法的结构。示意图根据本简讯绘制。