研究人员提出了 CapFrame——一种根据文本指令在 3D Gaussian Splatting 场景中定位 6-DoF 相机姿态的方法,使渲染出的画面与描述相符。该工作已发表在 arXiv 上,代码已开源。作者引入了一个新任务 Text-Instructed Viewpoint Grounding (TIVG),并通过 Retrieve-Translate-Refine 流程来解决:首先用 MLLM 筛选相关视角,然后将指令转换为几何伪标签(朝向与构图),最后通过可微优化精修相机姿态。详情见
arXiv 上的论文。
这意味着什么
CapFrame 与我们指南中的
Gaussian Splatting (3DGS) 直接相关:该方法运行在该 3D 生成器创建的场景之上。3DGS 参数表显示,这是 Inria 和 MPII 的开源实现,使用 Python 编写并带有 CUDA 扩展,训练到论文中的质量需要 24 GB 显存。CapFrame 并不改变场景训练过程本身——它是在之后增加一个阶段:根据已完成的 3DGS 场景和文本查询来寻找相机姿态。
对于指南用户来说,这意味着在 3DGS 场景中控制虚拟相机可能不再需要手动操作。目前 3DGS 参数表中没有任何关于语言控制视角的内容——原始实现专注于新视角合成,而不是如何根据描述选择画面。CapFrame 填补了这一空白,但它是作为外部工具,而非 3DGS 主仓库的一部分。
论文中的局限性值得注意:作者仅在 38 个场景和 135 条指令上评估了该方法,这不足以判断其在任意场景上的表现。CapFrame 代码的许可证在描述中未提及,运行所需的显存要求也未说明——这些参数在集成到工作流之前需要单独核实。
方法的工作原理。示意图根据这篇简讯绘制。