VCAR: сегментация 3DGS без обучения через полноту обзора и уточнение границ по осям
Авторы работы VCAR: Training-Free 3DGS Segmentation via View Completeness and Axis-Aware Boundary Refinement предлагают метод семантической сегментации сцен 3D Gaussian Splatting, который не требует обучения на каждой сцене. Подход двухэтапный: сначала грубая локализация объекта через взвешенное мультиракурсное голосование, затем уточнение границ с дополнительными ракурсами, сгенерированными по сферической спирали вокруг объекта. Отдельный модуль Axis-aware Boundary Refinement сжимает анизотропные гауссианы вдоль доминирующей оси, чтобы уменьшить размытие границ. Код выложен в открытый доступ.
Что это значит
Работа напрямую касается Gaussian Splatting (3DGS) — базового метода, на котором строится сегментация. В нашем паспорте 3DGS описан как генератор 3D-моделей от Inria и MPII с открытым кодом, требующий по описанию авторов 24 ГБ видеопамяти для обучения до оценочного качества и работающий через PyTorch с CUDA-расширениями на Python. VCAR не меняет сам 3DGS, а добавляет поверх него этап сегментации без обучения, что снимает затраты на дообучение под каждую сцену.
Чего в паспорте 3DGS нет — это как раз семантической сегментации: исходный метод восстанавливает геометрию и внешний вид сцены, но не размечает объекты по смыслу. VCAR закрывает этот пробел как надстройка, и для пользователя это означает, что сегментация сцены 3DGS может выполняться без дополнительного обучения, если сцена уже восстановлена. Требования к памяти и платформе для самого VCAR разработчик в аннотации не уточняет.
Метод проверен на наборах NVOS и LERF, авторы заявляют о точности и эффективности на уровне современных подходов. Для тех, кто работает с 3DGS и нуждается в разметке объектов в сцене, это вариант, который не требует обучающего прогона под каждую новую сцену.Как устроен метод. Схема нарисована по этой заметке.