CPU3D3D、视频与音频的 AI 工具

SpatialCrafter 通过生成式代理将单张图像转化为可探索的 3D 场景

研究人员提出了 SpatialCrafter——一个从单张图像生成可探索 3D 场景的两阶段框架。该工作于 2026 年 8 月 27 日发表在 arXiv 上。作者没有直接使用带有不完整信号(如稀疏点云或 2D 全景图)的 video diffusion model,而是首先通过 PaSS Flow 模块构建全局 3D 代理,然后使用 Generative Deferred Refiner 细化场景外观。为了训练,他们收集了一个包含 115 个场景的混合数据集。作者没有发布代码。更多详情见 arXiv 上的文章

这意味着什么

SpatialCrafter 解决的是 image-to-scene 任务,即生成整个场景,而不是单个对象。这使其区别于我们指南中处理单个 3D 模型的工具。 OpenLRM 的任务是 image-to-3d:从单张图像生成一个 obj 格式的对象。其参数表中没有关于场景或代理几何的信息。 Hunyuan3D(混元3D)2.1 也从图像生成单个 3D 资源,侧重于 PBR 材质。其描述中未提及可探索场景或生成式代理。 TRELLIS 支持 image-to-3d 和 text-to-3d,输出为 glb 格式的带纹理网格。其参数表中未声明支持从单张图像生成场景。 目前 SpatialCrafter 仍是一项没有开源代码的研究工作,因此无法在实践中与现有工具进行比较。如果代码发布,这可能会将 AI 3D 部分扩展到场景生成,而不仅仅是单个模型。
SpatialCrafter: image-to-scene 两阶段可探索3D场景生成框架 单张图像 输入帧 无3D数据 无全景图 PaSS Flow 全局3D代理 场景结构 Generative Deferred Refiner 外观细化 3D场景 可探索 整个场景 混合数据集 115K个场景 用于训练 与同类工具的区别 OpenLRM:image-to-3d,单个物体 Hunyuan3D 2.1:单个资产 TRELLIS: image-to-3d, text-to-3d SpatialCrafter:整个场景 代码未开源——研究论文,arXiv 2026年8月27日
方法的工作原理。示意图根据这篇简讯绘制。

相关阅读