CPU3D3D、视频与音频的 AI 工具

MultiCube 推出可单独控制每个部件的 3D 对象生成

研究人员在 arXiv 上发表了论文 MultiCube: Compositional 3D Generation With Part-Level Semantic and Spatial Control,其中描述了一种生成复合 3D 对象的方法,可独立控制每个部分的语义和空间位置。输入包括全局文本提示、部分文本方案以及带有边界框的布局。输出是一个由多个网格组成的对象,每个指定部分对应一个网格。作者采用了两阶段扩散过程:首先生成一个整体网格,然后同时将其分割成多个部分。作者未公开代码。

这意味着什么

在我们的指南中,没有工具支持在单个部分级别进行控制。任务上最接近的生成器是 OpenLRMHunyuan3D(混元3D)2.1TRELLIS——它们都采用 image-to-3d 范式:根据单张图像或文本描述创建整体对象,不进行语义部分分割,也不控制它们的相对位置。 OpenLRM 导出结果为 obj 格式,TRELLIS 导出为 glb 格式,Hunyuan3D(混元3D)2.1 则分阶段生成形状和纹理。它们都不接受部分方案或空间布局作为输入条件。从这个意义上说,MultiCube 解决的是另一个问题:不是“根据图片创建对象”,而是“在指定位置用指定部分组装对象”。 由于代码未公开,目前无法在实践中验证该方法。对于需要逐部分控制的用户来说,MultiCube 目前仍是一项研究工作,而非工具。关于 3D 生成的整体介绍,可以查看指南页面
MultiCube:控制每个部件的3D对象生成 输入数据 全局文本 提示词 部件文本方案 带边界框的布局 阶段1 扩散过程 生成整体 mesh 阶段2 同时 拆分为部件 输出 由独立mesh组成的对象 每个对应 指定部件 最接近的同类:image-to-3d OpenLRM — obj TRELLIS — glb Hunyuan3D 2.1 — 形状和纹理 无拆分和布局控制 代码未开源
方法的工作原理。示意图根据这篇简讯绘制。

相关阅读