CPU3D3D、视频与音频的 AI 工具

Latte:视频生成器 — 功能与运行要求

Latte 是一款开源的视频生成器,基于 Latent Diffusion Transformer 架构构建。开发者将其定位为用于根据文本描述合成视频的研究工具,该工具已在 TMLR 2025 会议上发布。

功能

  • 根据文本描述生成视频(text-to-video)。
  • 采用 Latent Diffusion Transformer 方法——处理帧的隐式表示,而非逐像素生成。
  • 作者提供了预训练模型,可供下载并在本地运行。
  • 代码在 Apache-2.0 许可证下开源,允许在商业和非商业项目中使用和修改。

运行要求

  • 平台:据作者描述,运行需要 CUDA。同时,文档中指出,若要在本地中央处理器上运行预训练模型,可以从依赖文件中移除 cudatoolkitpytorch-cuda 依赖。
  • 语言:Python。
  • 许可证:Apache-2.0。
  • 仓库:github.com/Vchitect/Latte
  • 时效性:代码最后一次更新于 2025 年 10 月 30 日。

适用人群

该工具主要面向熟悉 Python 和 PyTorch 生态系统的研究人员和开发者。开源代码和 Apache-2.0 许可证使其成为视频扩散实验、模型微调或集成到自有流程中的便捷基础。即便存在一些限制,CPU 运行的可能性也降低了没有强大 GPU 用户的入门门槛。

对于寻求现成图形界面应用或无需配置环境的云服务的用户,Latte 并不适合——它本质上是一个用于本地部署的代码库。

作者未指明具体的显存或内存容量要求,因此运行前应参考扩散模型的典型资源需求,并在自己的设备上进行测试。

Latte 视频生成器流水线 Latent Diffusion Transformer — 开源,Apache-2.0 文本提示 场景描述 自然语言 文本编码器 转换 为嵌入 潜空间噪声 初始化 潜空间 Latte Transformer 扩散模型 生成帧 VAE 解码器 恢复 从潜变量到像素 视频文件 生成的 视频序列 运行环境 Python, CUDA CPU 模式可用 控制 Vchitect · github.com/Vchitect/Latte · TMLR 2025 · Apache-2.0
Latte 的处理流程。示意图依据工具参数表绘制。

参数表

代码许可证Apache-2.0 来源
平台cuda 据作者描述 来源
语言Python 来源
代码最近更新2025-10-30 来源
仓库创建时间2023-10-28 来源
经常变化 — 数据截至 2026-08-19
GitHub 星标1948 来源
Fork 数192 来源

数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。

相关阅读