CPU3DИИ-инструменты для 3D, видео и звука

CapFrame превращает текстовое описание кадра в позицию камеры для 3D Gaussian Splatting

Исследователи представили CapFrame — метод, который по текстовой инструкции находит 6-DoF позу камеры в сцене 3D Gaussian Splatting так, чтобы отрендеренный кадр соответствовал описанию. Работа опубликована на arXiv, код выложен в открытый доступ. Авторы вводят новую задачу Text-Instructed Viewpoint Grounding (TIVG) и решают её через конвейер Retrieve-Translate-Refine: сначала отбираются релевантные виды с помощью MLLM, затем инструкция переводится в геометрические псевдо-метки ориентации и компоновки, после чего поза камеры уточняется дифференцируемой оптимизацией. Подробности — в статье на arXiv.

Что это значит

CapFrame напрямую связан с Gaussian Splatting (3DGS) из нашего справочника: метод работает поверх сцен, созданных этим генератором 3D-моделей. В паспорте 3DGS указано, что это открытая реализация от Inria и MPII, написанная на Python с CUDA-расширениями и требующая 24 ГБ видеопамяти для обучения до качества из статьи. CapFrame не меняет сам процесс обучения сцены — он добавляет этап после: по готовой 3DGS-сцене и текстовому запросу ищется поза камеры. Для пользователей справочника это означает, что управление виртуальной камерой в 3DGS-сценах может перестать быть ручным. Сейчас в паспорте 3DGS нет ничего о языковом управлении точкой обзора — оригинальная реализация сосредоточена на синтезе новых видов, а не на том, как выбрать кадр по описанию. CapFrame закрывает этот пробел, но как внешний инструмент, а не как часть основного репозитория 3DGS. Ограничения из статьи стоит учитывать: авторы оценивали метод на 38 сценах и 135 инструкциях, что не позволяет судить о поведении на произвольных сценах. Лицензия кода CapFrame в изложении не указана, как и требования к видеопамяти для запуска — эти параметры придётся проверять отдельно перед интеграцией в рабочий процесс.
CapFrame: текст — поза камеры в 3DGS Вход текстовая инструкция и 3DGS-сцена Retrieve отбор видов через MLLM Translate псевдо-метки ориентации и компоновки Refine уточнение позы Выход 6-DoF поза камеры Ограничения 38 сцен, 135 инструкций лицензия и VRAM не указаны Конвейер Retrieve — Translate — Refine для задачи TIVG
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также