论文作者在
ROAD: Reciprocal-Objective Alignment of Discriminative Semantics for 3D Shape Generation 中提出了一种方法,仅在训练阶段使用判别式 3D 模型,以降低生成的计算成本。关键要素是 reciprocal-objective alignment,它通过 Holistic Semantic Condensing 和 Structural Optimal Alignment 来对齐生成模型和判别模型之间语义异质的潜在空间。在推理阶段不使用判别模型,因此没有额外成本。与工业基线 Step1X-3D 相比,该方法仅使用少量训练数据即可达到相当的质量。
这意味着什么
ROAD 是一个用于训练生成模型的研究框架,而非面向用户的现成工具。它并未在我们的
AI 3D 工具指南 中添加新模型,也不会直接改变现有生成器的工作方式。
在指南的工具中,与 image-to-3d 任务最接近的是
OpenLRM,它也采用了 Large Reconstruction Model 方法。然而,OpenLRM 并未应用 ROAD 中描述的潜在空间对齐策略——其训练不依赖于从判别式基础模型迁移知识。
Hunyuan3D(混元3D)2.1 和
TRELLIS 也解决 image-to-3d 任务,但它们的描述中未提及使用判别式 3D 模型来降低训练成本——这些工具的开发者并未报告此类优化。
ROAD 对上述工具的实际影响目前尚不存在:该方法作为研究发布,代码已公开,但指南中的任何生成器均未声明集成它。如果该方法被采纳,未来可能会降低生成模型新版本的训练成本,而不会增加推理要求。
方法的工作原理。示意图根据此简讯绘制。