CPU3D3D、视频与音频的 AI 工具

SceneReGen 从单张图像生成 3D 场景,在统一坐标系中生成对象

2026年8月25日,arXiv 上发布了一篇论文 SceneReGen: Generative Reconstruction of 3D Scenes from a Single Image。作者提出了一种基于单张图像进行 3D 场景生成式重建的方法:SceneReGen 不是将场景作为一个整体来重建,而是生成各个独立对象,并将它们组装到与观测对齐的公共坐标系中。核心思想是选择性姿态分解(selective pose factorization):对象的朝向直接编码在生成的网格中,而平移和缩放则从场景特征中单独估计。在 3D-FUTURE 子集上,该方法在场景级 CD、场景级 F-Score 和 3D 边界框 IoU 方面均优于所考察的其他方法。作者未公开代码。

这意味着什么

SceneReGen 解决的是我们指南中目前没有任何工具能够覆盖的任务。OpenLRMHunyuan3D(混元3D)2.1TRELLIS 都是基于单张图像生成单个 3D 模型的生成器(image-to-3d)。它们会在居中、按比例归一化的坐标系中生成一个对象。SceneReGen 则高一个层级:它接收场景图像和实例掩码,输出的是摆放在公共场景中的多个对象。 对象生成与场景重建之间的差距,正是作者所称的“表示鸿沟”(representation gap)。在我们的参数表中,这一差距直接可见:这三个工具的任务都标注为 image-to-3d,而非场景重建。它们都不接受实例掩码,也不会将多个对象组装成公共场景。 SceneReGen 目前尚无实际应用:代码未公开,权重未发布,开发者也未说明显存要求或导出格式。这是一项研究工作,它指明了方向——基于现成资产进行场景的生成式组装——但并未提供现成工具,无法与 CPU3D 指南中已有的工具进行对比。 如果作者公开代码和权重,SceneReGen 可能会成为我们指南中第一个用于生成式场景重建(而非单模型生成)的工具。目前,它只是值得关注的方向,而非现有生成器的替代品。
SceneReGen:3D 场景生成式重建 基于单张图像与实例掩码 输入 场景图像 实例掩码 SceneReGen 对象生成 在统一坐标系中 selective pose factorization 网格中的朝向、平移与缩放分别处理 输出 多个 3D 对象 在统一场景中排布 与单模型生成器的区别 OpenLRM image-to-3d Hunyuan3D 2.1 image-to-3d TRELLIS image-to-3d SceneReGen scene reconstruction 3D-FUTURE 上的结果 scene-level CD scene-level F-Score 3D bounding-box IoU
方法原理示意图。该图根据这篇简讯绘制。

相关阅读