CPU3D3D、视频与音频的 AI 工具

ROAD 通过迁移判别模型知识降低 3D 生成训练成本

论文作者在 ROAD: Reciprocal-Objective Alignment of Discriminative Semantics for 3D Shape Generation 中提出了一种方法,仅在训练阶段使用判别式 3D 模型,以降低生成的计算成本。关键要素是 reciprocal-objective alignment,它通过 Holistic Semantic Condensing 和 Structural Optimal Alignment 来对齐生成模型和判别模型之间语义异质的潜在空间。在推理阶段不使用判别模型,因此没有额外成本。与工业基线 Step1X-3D 相比,该方法仅使用少量训练数据即可达到相当的质量。

这意味着什么

ROAD 是一个用于训练生成模型的研究框架,而非面向用户的现成工具。它并未在我们的 AI 3D 工具指南 中添加新模型,也不会直接改变现有生成器的工作方式。 在指南的工具中,与 image-to-3d 任务最接近的是 OpenLRM,它也采用了 Large Reconstruction Model 方法。然而,OpenLRM 并未应用 ROAD 中描述的潜在空间对齐策略——其训练不依赖于从判别式基础模型迁移知识。Hunyuan3D(混元3D)2.1TRELLIS 也解决 image-to-3d 任务,但它们的描述中未提及使用判别式 3D 模型来降低训练成本——这些工具的开发者并未报告此类优化。 ROAD 对上述工具的实际影响目前尚不存在:该方法作为研究发布,代码已公开,但指南中的任何生成器均未声明集成它。如果该方法被采纳,未来可能会降低生成模型新版本的训练成本,而不会增加推理要求。
生成式 3D 模型 可训练的生成器 形状 判别式 3D 模型 基础 分类器 知识 迁移 Reciprocal-Objective Alignment 潜在空间 对齐 Holistic Semantic Condensing 语义压缩 Structural Optimal Alignment 结构 对齐 推理 仅生成器 无额外开销 3D 形状 质量与…相当 Step1X-3D 少量 训练数据 ROAD:降低 3D 生成器训练成本
方法的工作原理。示意图根据此简讯绘制。

相关阅读