CogVideoX: генератор видео — что умеет и что нужно для запуска

Перед нами CogVideoX — генератор видео по текстовому описанию с открытым исходным кодом. Разработчик, компания Zhipu AI, позиционирует его как инструмент для превращения текстовых подсказок в видеоролики. Модель также упоминается в связке с генерацией видео из изображений, хотя основная задача в паспорте обозначена как text-to-video.
Что умеет
Авторы описывают CogVideoX как систему для генерации видео по тексту и изображению. В репозитории проект помечен метками text-to-video и image-to-video, что указывает на два режима работы. Среди ключевых слов также значатся llm и sora — это даёт понять, что в основе лежат языковые модели, а сама технология относится к классу решений, аналогичных Sora. Подробностей о максимальной длительности ролика или поддерживаемых разрешениях в паспорте нет.
Что нужно для запуска
Код написан на Python и распространяется по лицензии Apache-2.0. Веса модели имеют иную лицензию — other. Для работы потребуется видеокарта NVIDIA с поддержкой CUDA. Дословно из описания авторов: устройства с NVIDIA H100 и выше, требуется установка пакетов torch и torchao из исходного кода. Рекомендуемая версия CUDA — 12.4. Самый большой файл весов занимает 9,2 ГБ, а полный объём всех файлов — 20 ГБ. Модель интегрирована в библиотеку diffusers. Локальный запуск возможен, но требования к оборудованию весьма специфичны.
Кому подойдёт
Инструмент рассчитан на разработчиков и исследователей, у которых есть доступ к мощным серверным ускорителям. Открытый код и наличие репозитория на GitHub позволяют изучать архитектуру и дорабатывать модель под свои задачи. Для бытового использования на пользовательских видеокартах CogVideoX, судя по заявленным требованиям, не предназначен. Тем, кто ищет облачный сервис без необходимости настройки окружения, также стоит присмотреться к другим решениям — здесь потребуется ручная сборка зависимостей и работа с Python-кодом.
Модель продолжает развиваться: последнее изменение кода датировано ноябрём 2025 года, а последний выпуск обозначен как v1.0. Это говорит о том, что проект находится в активной фазе поддержки, но пока не обзавёлся массой промежуточных релизов.
Паспорт
Репозиторий · Модель на HuggingFace
| Задача | text-to-video источник |
|---|---|
| Лицензия кода | Apache-2.0 источник |
| Лицензия весов | other источник |
| Платформа | CUDA по описанию автора источник |
| Самый большой файл весов | 9.2 ГБ источник |
| Все файлы весов | 20 ГБ источник |
| Библиотека | diffusers источник |
| Язык | Python источник |
| Последнее изменение кода | 2025-11-04 источник |
| Репозиторий создан | 2022-05-29 источник |
| Последний выпуск | v1.0 источник |
|---|---|
| Дата выпуска | 2024-11-08 источник |
| Звёзд на GitHub | 12929 источник |
| Форков | 1324 источник |
| Загрузок за месяц | 15821 источник |
| Обновление модели | 2024-11-23 источник |
Значения собраны автоматически из официальных источников и проверены 03.08.2026. Цен и лимитов тарифов в паспорте нет: они меняются чаще, чем обновляется страница — смотрите официальный сайт.



