ABot-Recon вышла на HuggingFace: потоковая 3D-реконструкция из видео
На HuggingFace 26 августа 2026 года опубликована модель acvlab/ABot-Recon. Авторы описывают её как потоковую модель 3D-реконструкции, которая оценивает движение камеры и геометрию сцены онлайн по длинным видео, удерживая в памяти лишь локальный контекст из 12 кадров. Модель предсказывает карту точек в текущей системе координат камеры и относительную позу соседнего кадра, после чего собирает локальные предсказания в глобальную реконструкцию. Веса выложены в формате safetensors, самый большой файл — 3.7 ГБ, лицензия — apache-2.0. Код открыт, ссылку на репозиторий поставит движок.
Что это значит
В нашем справочнике по теме image-to-3d представлены OpenLRM, Hunyuan3D 2.1 и TRELLIS. Все три — генераторы 3D-моделей по одному изображению. ABot-Recon решает другую задачу: она восстанавливает геометрию сцены и траекторию камеры из видеопотока, а не создаёт ассет по картинке. Прямого пересечения по сценарию использования с нашими карточками нет.
По весу ABot-Recon сопоставима с Hunyuan3D 2.1, у которой самый большой файл весов — 6.9 ГБ, но заметно тяжелее TRELLIS (1.1 ГБ) и OpenLRM (1.7 ГБ). Лицензия apache-2.0 совпадает с лицензией кода OpenLRM и мягче, чем cc-by-nc-4.0 у весов OpenLRM. Требования к видеопамяти и платформа запуска в карточке модели не указаны — разработчик не уточняет.
Тем, кто ищет инструмент для генерации 3D-моделей по одному изображению, ABot-Recon не подойдёт: это модель для реконструкции сцен из видео. Если же задача — восстановить геометрию по длинной видеозаписи, стоит смотреть в сторону этой модели, но требования к железу придётся уточнять в репозитории.Как устроен метод. Схема нарисована по этой заметке.