CPU3DИИ-инструменты для 3D и видео

CogVideoX: генератор видео — что умеет и что нужно для запуска

Перед нами CogVideoX — генератор видео по текстовому описанию с открытым исходным кодом. Разработчик, компания Zhipu AI, позиционирует его как инструмент для превращения текстовых подсказок в видеоролики. Модель также упоминается в связке с генерацией видео из изображений, хотя основная задача в паспорте обозначена как text-to-video.

Что умеет

Авторы описывают CogVideoX как систему для генерации видео по тексту и изображению. В репозитории проект помечен метками text-to-video и image-to-video, что указывает на два режима работы. Среди ключевых слов также значатся llm и sora — это даёт понять, что в основе лежат языковые модели, а сама технология относится к классу решений, аналогичных Sora. Подробностей о максимальной длительности ролика или поддерживаемых разрешениях в паспорте нет.

Что нужно для запуска

Код написан на Python и распространяется по лицензии Apache-2.0. Веса модели имеют иную лицензию — other. Для работы потребуется видеокарта NVIDIA с поддержкой CUDA. Дословно из описания авторов: устройства с NVIDIA H100 и выше, требуется установка пакетов torch и torchao из исходного кода. Рекомендуемая версия CUDA — 12.4. Самый большой файл весов занимает 9,2 ГБ, а полный объём всех файлов — 20 ГБ. Модель интегрирована в библиотеку diffusers. Локальный запуск возможен, но требования к оборудованию весьма специфичны.

Кому подойдёт

Инструмент рассчитан на разработчиков и исследователей, у которых есть доступ к мощным серверным ускорителям. Открытый код и наличие репозитория на GitHub позволяют изучать архитектуру и дорабатывать модель под свои задачи. Для бытового использования на пользовательских видеокартах CogVideoX, судя по заявленным требованиям, не предназначен. Тем, кто ищет облачный сервис без необходимости настройки окружения, также стоит присмотреться к другим решениям — здесь потребуется ручная сборка зависимостей и работа с Python-кодом.

Модель продолжает развиваться: последнее изменение кода датировано ноябрём 2025 года, а последний выпуск обозначен как v1.0. Это говорит о том, что проект находится в активной фазе поддержки, но пока не обзавёлся массой промежуточных релизов.

Конвейер CogVideoX Текстовый промпт Вход Кодировщик текста LLM Трансформер видео CogVideoX-5b Декодер кадров diffusers Видео Выход MP4 Изображение Опциональный вход Платформа: CUDA 12.4 · NVIDIA H100 · torch · torchao · Python
Как устроен конвейер CogVideoX. Схема нарисована по паспорту инструмента.

Паспорт

Задачаtext-to-video источник
Лицензия кодаApache-2.0 источник
Лицензия весовother источник
ПлатформаCUDA по описанию автора источник
Самый большой файл весов9.2 ГБ источник
Все файлы весов20 ГБ источник
Библиотекаdiffusers источник
ЯзыкPython источник
Последнее изменение кода2025-11-04 источник
Репозиторий создан2022-05-29 источник
Меняется часто — данные на 03.08.2026
Последний выпускv1.0 источник
Дата выпуска2024-11-08 источник
Звёзд на GitHub12929 источник
Форков1324 источник
Загрузок за месяц15821 источник
Обновление модели2024-11-23 источник

Значения собраны автоматически из официальных источников и проверены 03.08.2026. Цен и лимитов тарифов в паспорте нет: они меняются чаще, чем обновляется страница — смотрите официальный сайт.

Смотрите также