CPU3D3D、视频与音频的 AI 工具

MegaParts 将 3D 对象按部件生成扩展至 300 个零件

研究人员推出了 MegaParts——一个用于生成按语义部件拆分的 3D 对象的框架。该方法的核心理念是向量量化分词器,它将每个部件的几何形状压缩为具有自适应长度的离散令牌,以及一个语言模型,在统一的结构化序列中生成对象的 bounding box、部件的 bounding box 和形状令牌。作者声称可扩展到 300 个部件和最长 256k 令牌的序列,并且与基础的回归和扩散模型相比,网格质量更高。代码尚未发布。详见 arXiv 上的文章

这意味着什么

MegaParts 解决了一个现有生成器(来自我们的指南)未能直接覆盖的任务:生成具有由数十到数百个语义部件构成的显式结构的对象。 OpenLRM 的任务是 image-to-3d,输出是一个没有部件拆分的单一网格。作者既没有描述部件数量的限制,也没有描述单独生成部件的机制——该模型是整体重建对象。 Hunyuan3D(混元3D)2.1 同样作为 image-to-3d 工作,输出带有 PBR 材质的完整资源。描述中没有提到 part-aware 生成或对单个部件级别的控制。 TRELLIS 使用结构化的 3D 潜在表示,但在参数表中没有声明将对象生成为具有单独控制的语义部件组装体。其任务是 image-to-3d 和 text-to-3d,导出为 glb。 MegaParts 是一项没有发布代码的研究工作,因此目前还无法与可用工具进行实际比较。如果该方法获得开源实现,它可能会扩展可控建模和按部件编辑的能力,而这些目前在指南中尚不存在。
MegaParts:按部件生成 3D 对象 最多 300 个语义部件,序列最长 256k 个 token 输入 3D 对象 带语义部件 VQ 分词器 几何压缩 为离散 token 语言模型 结构生成 和形状 token 输出 mesh 按部件 与现有方法对比 OpenLRM image-to-3d 单一网格 无拆分 Hunyuan3D 2.1 image-to-3d 完整资产 PBR 材质 TRELLIS 结构化 3D 潜变量 无部件感知 MegaParts 最多 300 个部件 256k 个 token 部件感知生成 代码未开源——无法对比
方法的工作原理。示意图根据这篇简讯绘制。

相关阅读