CPU3D3D、视频与音频的 AI 工具

FixAnything 通过视频生成模型改进 3D 场景渲染

研究人员推出了 FixAnything —— 一个统一的模型,用于修复不同 3D 表示(包括 Gaussian Splatting、NeRF、网格和点云)中的渲染伪影。作者没有为每种格式设计专门的架构,而是使用预训练的视频生成模型,只需极少的微调,将任务表述为 video-to-video 转换。二进制掩码指示哪些像素应被视为干净的,而通过运动恢复结构恢复的相机姿态质量则作为直接偏好优化的奖励信号。详情见 arXiv 上的文章

这意味着什么

对于 Gaussian Splatting (3DGS) 来说,这是直接相关的:该方法被宣称是专门用于提升 3DGS 渲染质量的方式(在其他表示中也是如此)。在我们的 3DGS 参数表中,它是一个来自 Inria 和 MPII 的开源 3D 生成器,需要 24 GB 显存和 CUDA。在稀疏输入视角下出现伪影是这种方法的已知弱点,而 FixAnything 提出在已训练的场景之上增加一个外部清理层,而不改变 3DGS 本身的流程。 重要提示:作者尚未发布代码,因此目前无法验证与参考 3DGS 实现的兼容性,也无法评估实际的内存需求。3DGS 参数表中没有关于此类后处理方法的任何数据——这是一个新的领域,当前工具描述尚未覆盖。 如果该方法在实践中得到验证,它可能会降低 3DGS 及相关表示对输入图像密度的要求。不过目前这仍是一项没有公开代码的研究工作,评估其在生产流程中的适用性还为时过早。
FixAnything:通过视频生成模型清理渲染 输入 带伪影的渲染 3DGS, NeRF, mesh, point clouds 二值掩码 干净像素 已标记 视频生成 模型 video-to-video 转换 最小 微调 输出 清理后的渲染 无伪影 DPO direct preference optimization SfM structure-from-motion 相机姿态质量 外部清理层 代码未开源 FixAnything 不改变 3DGS 流程——在训练好的场景之上添加外部清理层
方法的工作原理。示意图根据这篇简讯绘制。

相关阅读