nano-world-model:视频生成器 — 功能与运行要求

nano-world-model 是一个开源视频生成器,作者将其定位为用于世界模型研究的极简工具集。该仓库面向的任务不是单纯生成视频画面,而是使用能够预测场景演变的模型,包括用于规划和机器人控制。
功能
据作者描述,该项目是“一个自带电池的极简仓库,用于推进世界模型科学”。仓库标签中列出:
- 视频生成与流式视频;
- 扩散模型与 diffusion-forcing;
- 模型预测控制;
- 规划;
- 机器人操作。
作者没有给出所支持的生成场景的详细列表,也没有说明视频时长和分辨率的限制。该仓库所引用的模型与 point-maze 任务相关,这表明它处理的是轨迹和空间场景,而不是任意文本描述的剧情。
运行要求
代码使用 Python 编写,基于 PyTorch 库。代码许可证为 MIT。据作者描述,运行需要 CUDA 平台;文档中提到了“CUDA wheels 和所有依赖”,并指向环境配置章节。
权重文件占用 0.6 GB——这是模型所有文件的总体积,最大的单个文件同样为 0.6 GB。模型托管在 Hugging Face 上。作者没有说明显存的最低要求,也没有指定 CUDA 和 PyTorch 的具体版本。
适合谁
该项目主要面向从事世界模型、扩散模型和强化学习的研究人员。对于需要紧凑的开源代码,在规划和机器人技术背景下进行视频生成实验,而非现成用户工具的人来说,它会很有用。
对于寻找具有完善界面、能在任意剧情上提供可预期质量的文本描述视频生成器的人来说,这个仓库很可能并不合适:作者并未将其描述为应用型服务,而是把重点放在研究的极简性和处理特定类别任务上。
nano-world-model 是一个开源研究项目,为世界模型实验和规划任务中的视频生成提供了起点。它的价值不在于用户场景的广泛性,而在于代码的可得性,以及研究和修改作者所采用方法的可能性。
参数表
代码仓库 · HuggingFace 模型 · 开发者网站
| 代码许可证 | MIT 来源 |
|---|---|
| 平台 | CUDA 据作者描述 来源 |
| 最大权重文件 | 0.6 GB 来源 |
| 全部权重文件 | 0.6 GB 来源 |
| 库 | pytorch 来源 |
| 语言 | Python 来源 |
| 代码最近更新 | 2026-09-08 来源 |
| 仓库创建时间 | 2026-04-30 来源 |
数值由程序自动从官方来源采集,并于 2026-09-10 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。



