CPU3D3D、视频与音频的 AI 工具

LTX-Video:视频生成器 — 功能与运行要求

LTX-Video — 这是一款由 Lightricks 公司开发的开源视频生成器,解决的是 image-to-video 任务。该工具可以将静态图像转换为视频片段,支持在自己的硬件上本地运行。

功能

作者将这款模型定位为基于图像生成视频(image-to-video)的解决方案。仓库的标签中还提到了 text-to-video 和 image-to-video-generation 任务,表明文本描述也可以作为附加条件使用。其底层架构基于 diffusion-models 和 dit,代码使用 Python 编写,并与 diffusers 库集成。

运行要求

代码以 Apache-2.0 许可证开源,模型权重则按照开发者标注为“other”的许可证分发。最大的权重文件占用 26.6 GB,所有权重文件的总大小为 236.4 GB。

据作者描述,运行需要 1 GB 显存——原文为:“Requires only 1GB of VRAM”。官方声明支持 macOS 上的 MPS,搭配 PyTorch 2.3.0。代码库已在 Python 3.10.5、CUDA 12.2 环境下测试,并支持 PyTorch 2.1.2 及以上版本。仓库创建于 2024 年 11 月,最近一次代码更新是在 2026 年 1 月。

适合谁

该工具面向那些愿意在本地运行、并有足够磁盘空间存储权重文件的用户。官方宣称仅需 1 GB 显存,这使得该模型对广泛的 GPU 都较为友好,包括相对老旧或性能较低的显卡。对 MPS 的支持也让搭载 Apple Silicon 的 Mac 电脑可以运行。

不适合那些希望使用云服务、不想本地安装的用户——LTX-Video 需要从仓库自行部署。对于没有 Python 和命令行使用经验的用户来说,上手门槛可能较高。

模型和代码可在 GitHub 和 Hugging Face 上获取,更多信息可访问项目官网。由于权重许可证标注为“other”,在商业使用前建议仔细阅读相关条款。

LTX-Video 流水线 图像与文本视频生成器 输入数据 原始图像 文本描述 生成参数 Image + Text Prompt 编码器 VAE 编码 文本分词 潜在表示 VAE + T5 Encoder DiT 变换器 扩散模型 噪声预测 迭代去噪 显存:1 GB Diffusion Transformer 解码器 VAE 解码 帧重建 帧数 VAE Decoder 结果:视频 基于输入图像和文本描述生成的视频序列 格式:MP4 / GIF / 帧序列 Text-to-Video(备选模式) 平台:MPS (macOS) · Python 3.10 · PyTorch ≥ 2.1.2 · CUDA 12.2 库:Diffusers · 代码许可证:Apache-2.0 · 权重:26.6 GB(主)/ 236.4 GB(全部)
LTX-Video 的处理流程。示意图依据工具参数表绘制。

参数表

任务image-to-video 来源
代码许可证Apache-2.0 来源
权重许可证other 来源
平台MPS 据作者描述 来源
显存1 GB 据作者描述 来源
最大权重文件26.6 GB 来源
全部权重文件236.4 GB 来源
Python3.10 据作者描述 来源
diffusers 来源
语言Python 来源
代码最近更新2026-01-05 来源
仓库创建时间2024-11-20 来源
经常变化 — 数据截至 2026-08-19
GitHub 星标10799 来源
Fork 数1107 来源
月下载量550361 来源
模型更新2025-07-16 来源

数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。

相关阅读