2026年9月3日,arXiv 上发布了 OctWorld 的研究成果——一个基于扩散模型的视频生成框架,具备持续的 3D 记忆。它可以根据单张图像,沿着指定的相机轨迹生成长视频序列,即使在回到已访问过的区域时也能保持场景一致性。其关键组件是 OctMap——一个带有 TSDF 融合的稀疏八叉树,用于累积视觉观测和深度图。作者声称,OctMap 优于点缓存和固定分辨率的 TSDF 体积,但代码尚未公开。详情请见
arXiv 上的论文页面。
这意味着什么
OctWorld 解决的是视频生成问题,而非 3D 模型创建,因此它并不直接与我们
3D 生成器(按图像) 部分中的工具竞争。但就内存和 3D 表示方法而言,进行比较是合适的。
OpenLRM 的最大权重文件为 1.7 GB,所有文件共 3.4 GB,任务是 image-to-3d,导出格式为 obj。它是一个静态模型生成器,而非视频序列生成器,因此不需要 OctMap 那样的 3D 记忆。
Hunyuan3D(混元3D)2.1 更重:最大权重文件为 6.9 GB,所有文件共 13.9 GB,显存需求从 10 GB 到 29 GB 不等。它同样从单张图像生成静态 3D 资产,不涉及相机轨迹和视频的长期一致性。
TRELLIS 是一个 3D 模型生成器,最大权重文件为 1.1 GB,导出格式为 glb。与其他工具一样,它不处理视频序列,也不在帧之间存储 3D 记忆。
OctWorld 的有趣之处在于,它将持续 3D 表示的理念引入了视频生成。对于我们工具的用户来说,这目前更像是一项研究工作:没有代码,且任务是生成长且一致的视频,而非 3D 资产。
方法的工作原理。示意图根据这篇简讯绘制。