CPU3D3D、视频与音频的 AI 工具

nano-world-model:视频生成器 — 功能与运行要求

nano-world-model 是一个开源视频生成器,作者将其定位为用于世界模型研究的极简工具集。该仓库面向的任务不是单纯生成视频画面,而是使用能够预测场景演变的模型,包括用于规划和机器人控制。

功能

据作者描述,该项目是“一个自带电池的极简仓库,用于推进世界模型科学”。仓库标签中列出:

  • 视频生成与流式视频;
  • 扩散模型与 diffusion-forcing;
  • 模型预测控制;
  • 规划;
  • 机器人操作。

作者没有给出所支持的生成场景的详细列表,也没有说明视频时长和分辨率的限制。该仓库所引用的模型与 point-maze 任务相关,这表明它处理的是轨迹和空间场景,而不是任意文本描述的剧情。

运行要求

代码使用 Python 编写,基于 PyTorch 库。代码许可证为 MIT。据作者描述,运行需要 CUDA 平台;文档中提到了“CUDA wheels 和所有依赖”,并指向环境配置章节。

权重文件占用 0.6 GB——这是模型所有文件的总体积,最大的单个文件同样为 0.6 GB。模型托管在 Hugging Face 上。作者没有说明显存的最低要求,也没有指定 CUDA 和 PyTorch 的具体版本。

适合谁

该项目主要面向从事世界模型、扩散模型和强化学习的研究人员。对于需要紧凑的开源代码,在规划和机器人技术背景下进行视频生成实验,而非现成用户工具的人来说,它会很有用。

对于寻找具有完善界面、能在任意剧情上提供可预期质量的文本描述视频生成器的人来说,这个仓库很可能并不合适:作者并未将其描述为应用型服务,而是把重点放在研究的极简性和处理特定类别任务上。

nano-world-model 是一个开源研究项目,为世界模型实验和规划任务中的视频生成提供了起点。它的价值不在于用户场景的广泛性,而在于代码的可得性,以及研究和修改作者所采用方法的可能性。

nano-world-model 流水线 输入数据 帧流 环境状态 编码器 压缩为潜变量 场景特征 世界模型 动态预测 规划 解码器 重建 视频帧 结果 视频流 帧预测 流式生成 diffusion-forcing · model-predictive-control pytorch · CUDA · Python 模型:nanowm-b2-dino-wm-point-maze-30k 权重:0.6 GB · 许可证 MIT · 开源
nano-world-model 的处理流程。示意图依据工具参数表绘制。

参数表

代码许可证MIT 来源
平台CUDA 据作者描述 来源
最大权重文件0.6 GB 来源
全部权重文件0.6 GB 来源
pytorch 来源
语言Python 来源
代码最近更新2026-09-08 来源
仓库创建时间2026-04-30 来源
经常变化 — 数据截至 2026-09-10
GitHub 星标733 来源
Fork 数49 来源
月下载量50 来源
模型更新2026-04-22 来源

数值由程序自动从官方来源采集,并于 2026-09-10 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。

相关阅读