CPU3D3D、视频与音频的 AI 工具

CapFrame 将帧的文本描述转换为 3D Gaussian Splatting 中的相机位置

研究人员提出了 CapFrame——一种根据文本指令在 3D Gaussian Splatting 场景中定位 6-DoF 相机姿态的方法,使渲染出的画面与描述相符。该工作已发表在 arXiv 上,代码已开源。作者引入了一个新任务 Text-Instructed Viewpoint Grounding (TIVG),并通过 Retrieve-Translate-Refine 流程来解决:首先用 MLLM 筛选相关视角,然后将指令转换为几何伪标签(朝向与构图),最后通过可微优化精修相机姿态。详情见 arXiv 上的论文

这意味着什么

CapFrame 与我们指南中的 Gaussian Splatting (3DGS) 直接相关:该方法运行在该 3D 生成器创建的场景之上。3DGS 参数表显示,这是 Inria 和 MPII 的开源实现,使用 Python 编写并带有 CUDA 扩展,训练到论文中的质量需要 24 GB 显存。CapFrame 并不改变场景训练过程本身——它是在之后增加一个阶段:根据已完成的 3DGS 场景和文本查询来寻找相机姿态。 对于指南用户来说,这意味着在 3DGS 场景中控制虚拟相机可能不再需要手动操作。目前 3DGS 参数表中没有任何关于语言控制视角的内容——原始实现专注于新视角合成,而不是如何根据描述选择画面。CapFrame 填补了这一空白,但它是作为外部工具,而非 3DGS 主仓库的一部分。 论文中的局限性值得注意:作者仅在 38 个场景和 135 条指令上评估了该方法,这不足以判断其在任意场景上的表现。CapFrame 代码的许可证在描述中未提及,运行所需的显存要求也未说明——这些参数在集成到工作流之前需要单独核实。
CapFrame:文本 — 3DGS 中的相机位姿 输入 文本指令 和 3DGS 场景 Retrieve 通过 MLLM 选择视角 Translate 方向伪标签 和布局 Refine 位姿细化 输出 6-DoF 相机位姿 限制 38 个场景,135 条指令 许可证和显存未注明 面向 TIVG 任务的 Retrieve — Translate — Refine 流程
方法的工作原理。示意图根据这篇简讯绘制。

相关阅读