研究人员提出了 SpatialCrafter——一个从单张图像生成可探索 3D 场景的两阶段框架。该工作于 2026 年 8 月 27 日发表在 arXiv 上。作者没有直接使用带有不完整信号(如稀疏点云或 2D 全景图)的 video diffusion model,而是首先通过 PaSS Flow 模块构建全局 3D 代理,然后使用 Generative Deferred Refiner 细化场景外观。为了训练,他们收集了一个包含 115 个场景的混合数据集。作者没有发布代码。更多详情见
arXiv 上的文章。
这意味着什么
SpatialCrafter 解决的是 image-to-scene 任务,即生成整个场景,而不是单个对象。这使其区别于我们指南中处理单个 3D 模型的工具。
OpenLRM 的任务是 image-to-3d:从单张图像生成一个 obj 格式的对象。其参数表中没有关于场景或代理几何的信息。
Hunyuan3D(混元3D)2.1 也从图像生成单个 3D 资源,侧重于 PBR 材质。其描述中未提及可探索场景或生成式代理。
TRELLIS 支持 image-to-3d 和 text-to-3d,输出为 glb 格式的带纹理网格。其参数表中未声明支持从单张图像生成场景。
目前 SpatialCrafter 仍是一项没有开源代码的研究工作,因此无法在实践中与现有工具进行比较。如果代码发布,这可能会将
AI 3D 部分扩展到场景生成,而不仅仅是单个模型。
方法的工作原理。示意图根据这篇简讯绘制。