arXiv 上发布了一篇关于 ES3D 的论文——这是一个用于 3D 资产组件化编辑的框架。作者提出将语义直接嵌入 3D 空间:多视角语义特征被投影到资产的体素化空间中,随后根据与图像或文本查询嵌入的相似性来定位所需组件。编辑操作由预训练生成式 3D 模型配合 inpainting 机制完成,该机制根据参考图像修改已定位的组件,同时保留其余几何结构。作者未公开代码。更多详情见 arXiv 上的论文。
这意味着什么
ES3D 解决的是我们指南中工具参数表里没有的任务。OpenLRM、Hunyuan3D(混元3D)2.1 和 TRELLIS 都是基于单张图像生成模型的工具(image-to-3d)。它们会整体生成资产,并不提供根据语义查询选择单个组件或在不影响其余几何结构的情况下进行局部编辑的机制。
与这一主题最接近的是 TRELLIS:其描述中提到了结构化的 3D 潜变量,这些潜变量可能实现更可控的生成,但参数表中没有关于组件搜索或多个参考图编辑的信息。Hunyuan3D(混元3D)2.1 被定位为支持 PBR 材质的高细节资产生成器,但描述中并未提及组件语义标注或单独编辑。OpenLRM 是三款模型中最简单的一个,专注于基于图像的重建,没有任何组件控制机制。
目前 ES3D 仅作为一项研究性工作存在,没有开源代码,因此无法在实践中与现有工具进行比较。如果作者发布实现,这可能会拓展我们对 3D AI 工具板块中 3D 资产编辑方式的理解。方法的工作原理。示意图根据这篇简讯绘制。