MultiCube представил генерацию 3D-объектов с контролем каждой части по отдельности
Исследователи опубликовали на arXiv работу MultiCube: Compositional 3D Generation With Part-Level Semantic and Spatial Control, в которой описан метод генерации составных 3D-объектов с независимым управлением семантикой и пространственным расположением каждой части. На вход подаются глобальный текстовый промпт, текстовая схема частей и раскладка с bounding boxes. На выходе — объект из отдельных mesh, по одному на каждую указанную часть. Авторы используют двухстадийный диффузионный процесс: сначала генерируется монолитный mesh, затем он одновременно разбивается на части. Код авторы не выкладывали.
Что это значит
В нашем справочнике по этой теме нет инструментов с контролем на уровне отдельных частей. Ближайшие по задаче генераторы — OpenLRM, Hunyuan3D 2.1 и TRELLIS — работают в парадигме image-to-3d: они создают цельный объект по одному изображению или текстовому описанию, без разбиения на семантические части и без управления их взаимным расположением.
OpenLRM экспортирует результат в obj, TRELLIS — в glb, Hunyuan3D 2.1 генерирует shape и текстуры отдельными этапами. Ни один из них не принимает схему частей или пространственную раскладку как входное условие. MultiCube в этом смысле решает другую задачу: не «создать объект по картинке», а «собрать объект из заданных частей в заданных местах».
Поскольку код не опубликован, проверить метод на практике сейчас нельзя. Для пользователей, которым нужен именно покомпонентный контроль, MultiCube пока остаётся исследовательской работой, а не инструментом. Раздел о генерации 3D в целом можно посмотреть на странице справочника.Как устроен метод. Схема нарисована по этой заметке.