2026年8月21日,一篇题为
ArtiMo: Agent-Driven Articulated Mesh Animation 的论文在 arXiv 上发表。作者提出了一种框架,能够根据文本描述对复合 3D 网格进行动画处理,而无需对模型进行微调。其核心是基于 LLM 和 VLM 的智能体流水线:语言模型在考虑 URDF 运动学约束的情况下规划物体各部分的运动,而视觉模型则根据渲染的关键帧迭代检查结果并纠正错误。作者未公开代码。
这意味着什么
对于我们
视频生成器和 3D 动画 板块来说,这更像是一项相关研究,而非直接竞争对手。ArtiMo 不生成视频,也不创建网格——它基于现成的复合 3D 模型的运动学方案对其进行动画处理。在指南的工具中,没有直接类似的工具。
最接近的视频生成器工作原理不同。
LTX-Video 是 Lightricks 推出的 image-to-video 模型,采用开源(Apache-2.0)许可,最大权重文件为 26.6 GB,据作者描述仅需 1 GB 显存,并支持 macOS 上的 MPS。
CogVideoX(智谱 CogVideoX) 来自智谱 AI,解决 text-to-video 任务,最大文件权重为 9.2 GB,可在 CUDA 上运行。
Pyramid Flow(快手 Pyramid Flow) 同样是 text-to-video,代码采用 MIT 许可证,最大文件为 7.8 GB,需要至少 8 GB 显存。
ArtiMo 与这三者有着本质区别:它不是生成模型,而是一个编排器,利用现成的 LLM 和 VLM 来规划和验证运动。对于寻找“文本转视频”工具的用户来说,ArtiMo 毫无用处——它不渲染最终视频画面,而只是控制复合网格的动画。对于机器人技术或具有刚性骨骼的角色动画任务,这种方法可能很有趣,但在代码未公开的情况下,目前还无法在实践中进行验证。
方法的工作原理。示意图根据这篇简讯绘制。