2026年8月26日,HuggingFace 上发布了模型
acvlab/ABot-Recon。据作者描述,这是一种流式3D重建模型,能够根据长视频在线估计相机运动和场景几何结构,仅需在内存中保留12帧的局部上下文。该模型预测当前相机坐标系下的点图以及相邻帧的相对姿态,然后将局部预测整合为全局重建。权重以 safetensors 格式发布,最大文件为3.7 GB,许可证为 apache-2.0。代码已开源,仓库链接将由引擎提供。
这意味着什么
在我们的 image-to-3d 主题指南中,收录了
OpenLRM、
Hunyuan3D(混元3D)2.1 和
TRELLIS。这三者都是根据单张图像生成3D模型的生成器。ABot-Recon 解决的是另一个问题:它从视频流中恢复场景几何和相机轨迹,而不是根据图片创建资产。与我们的工具页面在使用场景上没有直接重叠。
在权重方面,ABot-Recon 与 Hunyuan3D(混元3D)2.1 相当,后者的最大权重文件为6.9 GB,但明显比 TRELLIS(1.1 GB)和 OpenLRM(1.7 GB)更重。apache-2.0 许可证与 OpenLRM 代码的许可证一致,且比 OpenLRM 权重的 cc-by-nc-4.0 更为宽松。模型页面中未注明显存要求和运行平台——开发者未作说明。
对于正在寻找根据单张图像生成3D模型工具的用户,ABot-Recon 并不适用:这是一款用于从视频中重建场景的模型。如果任务是恢复长视频记录中的几何结构,则值得关注该模型,但硬件要求需在仓库中进一步确认。
方法的工作原理。示意图根据这篇简讯绘制。