CPU3D3D、视频与音频的 AI 工具

Mochi 1:视频生成器——功能与运行要求

Mochi 1 是一款根据文本描述生成视频(text-to-video)的开源视频生成器,由 Genmo 公司开发。该工具用于根据提示合成视频片段,并支持本地运行和微调。

功能

据作者描述,该模型是开源视频生成解决方案中表现最好的之一。其主要任务是基于文本描述生成视频。开发者提供了在自有视频数据上进行微调(LoRA)的工具,使模型能够适应特定风格或对象。

运行要求

代码使用 Python 编写,并以 Apache-2.0 许可证分发。模型权重同样以 Apache-2.0 许可证提供。运行依赖 diffusers 库。完整权重文件集占用 124.3 GB,其中最大的文件为 37.4 GB。

据作者描述,运行和微调需要显存容量为 80 GB 的图形处理器,示例中提到的加速卡为 H100 或 A100。作者未描述在性能较低的设备上进行本地运行的情况。

源代码可在仓库中获取:github.com/genmoai/mochi。模型权重位于:huggingface.co/genmo/mochi-1-preview

适用人群

该工具面向能够使用大显存服务器 GPU 的研究人员和开发者。微调能力使其对处理自有视频数据集、希望将模型适配到特定任务的人群具有吸引力。

对于使用消费级显卡的用户,Mochi 1 很可能并不适用:开发者声明的显存要求远超主流 GPU 的能力。该工具也不适合在没有自有基础设施的情况下快速生成视频——作者未提供云服务版本。

Mochi 1 为研究社区提供了用于视频合成任务的开源代码库和权重。较高的显存门槛限制了用户范围,但为在专用设备上进行微调实验提供了空间。

Mochi 1 管线 — 视频生成器 Genmo 的开源 text-to-video 模型 文本提示 场景描述 自然语言 输入数据 分词器 文本拆分 为词元 预处理 扩散模型 帧生成 从噪声按文本 权重:124.3 GB 显存:80 GB(H100/A100) diffusers 库 视频 生成的 帧序列 代码和权重许可证:Apache 2.0 仓库:github.com/genmoai/mochi 模型:huggingface.co/genmo/mochi-1-preview 开源 · Python · 最后更新:2025年11月
Mochi 1 的处理流程。示意图依据工具参数表绘制。

参数表

任务text-to-video 来源
代码许可证Apache-2.0 来源
权重许可证apache-2.0 来源
显存80 GB 据作者描述 来源
最大权重文件37.4 GB 来源
全部权重文件124.3 GB 来源
diffusers 来源
语言Python 来源
代码最近更新2025-11-14 来源
仓库创建时间2024-09-11 来源
经常变化 — 数据截至 2026-08-19
GitHub 星标3704 来源
Fork 数489 来源
月下载量4605 来源
模型更新2025-09-04 来源

数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。

相关阅读