CPU3D3D、视频与音频的 AI 工具

video_to_world:3D 生成器 — 功能与运行要求

video_to_world — 开源 3D 生成器,可从视频扩散模型生成的序列中重建 3D 世界。作者将该方法描述为非刚性对齐,旨在消除生成视频中内部的三维不一致性。该工具适合从事生成式视频工作并希望从中获得立体场景的用户。

功能

据作者描述,该方法可从扩散模型生成的视频中重建三维世界。为此使用非刚性对齐,以补偿帧在三维空间中的不一致性。在代码库中,该项目被标记为 3d-reconstruction、video-diffusion 和 world-generation。

训练结果可导出为 PLY 格式 — 作者提到了将 3DGS 检查点保存为该格式的命令。参数表中未列出其他导出格式。

运行要求

代码使用 Python 编写,并以 MIT 许可证分发。据作者描述,平台为 CUDA:文档中提到了 tiny-cuda-nn,用于变形网络中的哈希网格编码。这意味着运行需要支持 CUDA 的图形处理器。作者未说明内存容量和具体库版本的要求。

源代码可在 github.com/lukasHoel/video_to_world 代码库中获取,更多信息请访问项目网站。

适用人群

该工具对研究和开发人员很有用,他们正在尝试从视频生成世界,并且可以使用支持 CUDA 的硬件。开放的 MIT 许可证允许将代码集成到自己的项目中并根据自身需求进行修改。

对于正在寻找带有图形界面的现成应用程序或无需显卡即可进行 CPU 渲染支持的用户,该项目很可能不适用:作者仅描述了通过 Python 代码和 CUDA 平台运行的方式。

video_to_world 是一款面向“视频扩散 — 3D 场景”组合的小众工具。它并非定位为通用的视频转模型转换器,需要了解训练和检查点导出的过程。

video_to_world 流程 从视频扩散重建三维世界 视频 输入帧序列 视频扩散 生成序列 序列 对齐 非刚性,消除 3D 不一致 变形 hash-grid 编码 tiny-cuda-nn 3D 模型 三维世界 导出:PLY 平台:CUDA 许可证:MIT 语言:Python
video_to_world 的处理流程。示意图依据工具参数表绘制。

参数表

代码许可证MIT 来源
平台cuda 据作者描述 来源
导出格式ply 据作者描述 来源
语言Python 来源
代码最近更新2026-08-06 来源
仓库创建时间2026-03-17 来源
经常变化 — 数据截至 2026-09-08
GitHub 星标305 来源
Fork 数32 来源

数值由程序自动从官方来源采集,并于 2026-09-08 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。

相关阅读