ES3D добавляет компонентное редактирование 3D через семантические эмбеддинги
На arXiv опубликована работа ES3D — фреймворк для компонентного редактирования 3D-ассетов. Авторы предлагают встраивать семантику непосредственно в 3D-пространство: мультиракурсные семантические признаки проецируются в вокселизированное пространство ассета, после чего нужные компоненты находятся по сходству с эмбеддингами изображений или текстовых запросов. Редактирование выполняет предобученная генеративная 3D-модель с механизмом inpainting, которая изменяет найденные компоненты по референсным изображениям, сохраняя остальную геометрию. Код авторы не выкладывали. Подробнее — в статье на arXiv.
Что это значит
ES3D решает задачу, которой нет в паспортах инструментов нашего справочника. OpenLRM, Hunyuan3D 2.1 и TRELLIS — это генераторы моделей по одному изображению (image-to-3d). Они создают ассет целиком и не предлагают механизма выбора отдельного компонента по семантическому запросу или его точечного редактирования с сохранением остальной геометрии.
Ближе всего к теме — TRELLIS: в его описании упомянуты структурированные 3D-латенты, которые потенциально могут давать более управляемую генерацию, но в паспорте нет сведений о компонентном поиске или редактировании по нескольким референсам. Hunyuan3D 2.1 заявлен как генератор высокодетализированных ассетов с PBR-материалами, однако о семантической разметке компонентов или их отдельном редактировании в описании ничего нет. OpenLRM — наиболее простая из трёх моделей, ориентированная на реконструкцию по изображению, без каких-либо механизмов компонентного контроля.
Пока ES3D существует только как исследовательская работа без открытого кода, поэтому сравнить её с доступными инструментами на практике нельзя. Если авторы опубликуют реализацию, это может расширить представление о том, как устроено редактирование 3D-ассетов в разделе AI-инструментов для 3D.Как устроен метод. Схема нарисована по этой заметке.