GAE-GeometricAutoEncoder:视频生成器 — 功能与运行要求

GAE-GeometricAutoEncoder 是 ARC Lab、Tencent PCG 推出的开源视频生成器。它解决的是 image-to-video 任务:根据单张图像生成视频序列,同时输出三维点云。开发者将该工具定位为通过几何原生隐空间实现 3D 一致世界生成的方式。
功能
该工具接收图像并生成视频。据作者描述,输出会形成三种产物:MP4 视频、轨迹可视化和 ply 格式的点云。这意味着除了平面视频序列之外,还可以获得场景的空间表示。
其核心是可在 Hugging Face 上获取的 GAE-D64-1B 模型。作者将该方法描述为训练几何原生隐空间以实现 3D 一致的世界生成。仓库标签中列出了 3D 重建、depth-anything-v3、VAE、视频生成、世界生成和世界模型。
运行要求
代码使用 Python 编写,库为 PyTorch。据作者描述,需要 Python 3.10—3.12 版本和 torch 2.5.1。DA3-GIANT 后端从 Hugging Face 拉取。
最大的单个权重文件为 3.5 GB,所有权重文件合计为 5.2 GB。在规划磁盘空间和下载时需要考虑到这一点。
代码许可证为 License Terms of Learning a Geometry-Native Latent Space。它允许自由使用、复制、修改、发布、分发、再许可和销售软件副本,但仅限于学术目的。任何非学术、商业或生产用途在任何情况下均被禁止。所有副本或软件的实质性部分都必须包含版权声明和许可文本。
仓库创建于 2026 年 9 月 16 日,代码最后修改于 2026 年 9 月 24 日。
适用人群
该工具面向在学术环境中从事视频生成和 3D 重建的研究人员和学生。能够在生成视频的同时获得点云,使其对于需要分析场景空间结构而不仅仅是平面图像的任务颇具吸引力。
它不适合商业开发、生产以及任何非学术项目:许可证明确禁止此类使用。此外还需注意,模型权重超过五千兆字节——对于性能较弱的机器和快速实验来说,这可能相当明显。
GAE-GeometricAutoEncoder 是一款应用范围界定清晰的科研工具。它将视频生成与获取三维点云结合起来,并基于 image-to-video 模式运行。学术许可证和可观的权重体积决定了它的受众:它更像是实验室,而非生产环境。
参数表
| 任务 | image-to-video 来源 |
|---|---|
| 代码许可证 | Learning a Geometry-Native Latent Space 的许可证条款:仅限学术用途 来源 |
| 最大权重文件 | 3.5 GB 来源 |
| 全部权重文件 | 5.2 GB 来源 |
| 导出格式 | ply 据作者描述 来源 |
| Python | 3.10 据作者描述 来源 |
| 库 | pytorch 来源 |
| 语言 | Python 来源 |
| 代码最近更新 | 2026-09-24 来源 |
| 仓库创建时间 | 2026-09-16 来源 |
数值由程序自动从官方来源采集,并于 2026-09-26 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。



