FixAnything улучшает рендеры 3D-сцен через видеогенеративные модели
Исследователи представили FixAnything — единую модель для исправления артефактов рендеринга в разных 3D-представлениях, включая Gaussian Splatting, NeRF, mesh и point clouds. Вместо специализированных архитектур под каждый формат авторы используют предобученную видеогенеративную модель с минимальной донастройкой, формулируя задачу как video-to-video трансляцию. Бинарная маска указывает, какие пиксели считать чистыми, а качество позы камеры, восстановленной через structure-from-motion, служит сигналом вознаграждения для direct preference optimization. Подробности — в статье на arXiv.
Что это значит
Для Gaussian Splatting (3DGS) это прямой адресат: метод заявлен как способ улучшения качества рендеров именно для 3DGS среди прочих представлений. В нашем паспорте 3DGS — открытый генератор 3D-моделей от Inria и MPII, требующий 24 ГБ видеопамяти и CUDA. Артефакты при разреженных входных ракурсах — известная слабость такого подхода, и FixAnything предлагает внешний слой очистки поверх уже обученной сцены, не меняя сам пайплайн 3DGS.
Важно: кода авторы не выкладывали, поэтому проверить совместимость с эталонной реализацией 3DGS или оценить реальные требования к памяти пока нельзя. В паспорте 3DGS нет данных о подобных методах постобработки — это новая ниша, не покрытая текущим описанием инструмента.
Если метод подтвердится на практике, он может снизить требования к плотности входных изображений для 3DGS и смежных представлений. Пока же это исследовательская работа без публичного кода, и оценить её применимость в рабочих пайплайнах рано.Как устроен метод. Схема нарисована по этой заметке.