Latte:视频生成器 — 功能与运行要求

Latte 是一款开源的视频生成器,基于 Latent Diffusion Transformer 架构构建。开发者将其定位为用于根据文本描述合成视频的研究工具,该工具已在 TMLR 2025 会议上发布。
功能
- 根据文本描述生成视频(text-to-video)。
- 采用 Latent Diffusion Transformer 方法——处理帧的隐式表示,而非逐像素生成。
- 作者提供了预训练模型,可供下载并在本地运行。
- 代码在 Apache-2.0 许可证下开源,允许在商业和非商业项目中使用和修改。
运行要求
- 平台:据作者描述,运行需要 CUDA。同时,文档中指出,若要在本地中央处理器上运行预训练模型,可以从依赖文件中移除
cudatoolkit和pytorch-cuda依赖。 - 语言:Python。
- 许可证:Apache-2.0。
- 仓库:github.com/Vchitect/Latte。
- 时效性:代码最后一次更新于 2025 年 10 月 30 日。
适用人群
该工具主要面向熟悉 Python 和 PyTorch 生态系统的研究人员和开发者。开源代码和 Apache-2.0 许可证使其成为视频扩散实验、模型微调或集成到自有流程中的便捷基础。即便存在一些限制,CPU 运行的可能性也降低了没有强大 GPU 用户的入门门槛。
对于寻求现成图形界面应用或无需配置环境的云服务的用户,Latte 并不适合——它本质上是一个用于本地部署的代码库。
作者未指明具体的显存或内存容量要求,因此运行前应参考扩散模型的典型资源需求,并在自己的设备上进行测试。
参数表
| 代码许可证 | Apache-2.0 来源 |
|---|---|
| 平台 | cuda 据作者描述 来源 |
| 语言 | Python 来源 |
| 代码最近更新 | 2025-10-30 来源 |
| 仓库创建时间 | 2023-10-28 来源 |
数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。



