SpatialCrafter превращает одно изображение в исследуемую 3D-сцену через генеративный прокси
Исследователи представили SpatialCrafter — двухэтапный фреймворк для генерации исследуемых 3D-сцен из одного изображения. Работа опубликована на arXiv 27 августа 2026 года. Вместо прямого использования video diffusion model с неполными сигналами вроде разреженных облаков точек или 2D-панорам авторы сначала строят глобальный 3D-прокси через модуль PaSS Flow, а затем уточняют внешний вид сцены с помощью Generative Deferred Refiner. Для обучения собран гибридный датасет из 115 тысяч сцен. Код авторы не выкладывали. Подробнее в статье на arXiv.
Что это значит
SpatialCrafter решает задачу image-to-scene, то есть генерации целой сцены, а не отдельного объекта. Это отличает его от инструментов в нашем справочнике, которые работают с одиночными 3D-моделями.
У OpenLRM задача — image-to-3d: из одного изображения получается один объект в формате obj. Про сцены или прокси-геометрию в паспорте ничего нет.
Hunyuan3D 2.1 тоже генерирует одиночный 3D-ассет из изображения, с упором на PBR-материалы. Исследуемые сцены и генеративные прокси в его описании не упоминаются.
TRELLIS поддерживает image-to-3d и text-to-3d, на выходе — текстурированный mesh в glb. Работа со сценами из одного изображения в паспорте не заявлена.
Пока SpatialCrafter остаётся исследовательской работой без открытого кода, поэтому сравнить его с доступными инструментами на практике нельзя. Если код появится, это может расширить раздел ИИ для 3D в сторону генерации сцен, а не только отдельных моделей.Как устроен метод. Схема нарисована по этой заметке.