CPU3D3D、视频与音频的 AI 工具

ABot-Recon 登陆 HuggingFace:从视频进行流式 3D 重建

2026年8月26日,HuggingFace 上发布了模型 acvlab/ABot-Recon。据作者描述,这是一种流式3D重建模型,能够根据长视频在线估计相机运动和场景几何结构,仅需在内存中保留12帧的局部上下文。该模型预测当前相机坐标系下的点图以及相邻帧的相对姿态,然后将局部预测整合为全局重建。权重以 safetensors 格式发布,最大文件为3.7 GB,许可证为 apache-2.0。代码已开源,仓库链接将由引擎提供。

这意味着什么

在我们的 image-to-3d 主题指南中,收录了 OpenLRMHunyuan3D(混元3D)2.1TRELLIS。这三者都是根据单张图像生成3D模型的生成器。ABot-Recon 解决的是另一个问题:它从视频流中恢复场景几何和相机轨迹,而不是根据图片创建资产。与我们的工具页面在使用场景上没有直接重叠。 在权重方面,ABot-Recon 与 Hunyuan3D(混元3D)2.1 相当,后者的最大权重文件为6.9 GB,但明显比 TRELLIS(1.1 GB)和 OpenLRM(1.7 GB)更重。apache-2.0 许可证与 OpenLRM 代码的许可证一致,且比 OpenLRM 权重的 cc-by-nc-4.0 更为宽松。模型页面中未注明显存要求和运行平台——开发者未作说明。 对于正在寻找根据单张图像生成3D模型工具的用户,ABot-Recon 并不适用:这是一款用于从视频中重建场景的模型。如果任务是恢复长视频记录中的几何结构,则值得关注该模型,但硬件要求需在仓库中进一步确认。
ABot-Recon:基于视频的流式3D重建 在线估计相机运动与场景几何 长视频 视频流 输入模型 ABot-Recon 流式模型 3D重建 局部上下文:12帧 局部上下文 内存中12帧 预测 点图 在当前 相机坐标系 相邻帧 相对位姿 全局 重建 拼接 局部 预测 模型特征 权重:safetensors,最大文件3.7 GB 许可证:apache-2.0 按权重对比: Hunyuan3D 2.1 — 6.9 GB,OpenLRM — 1.7 GB,TRELLIS — 1.1 GB 显存要求与运行平台未说明
方法的工作原理。示意图根据这篇简讯绘制。

相关阅读