CPU3DИИ-инструменты для 3D и видео

CogVideoX: генератор видео — что умеет и что нужно для запуска

Перед нами CogVideoX — генератор видео по текстовому описанию с открытым исходным кодом. Разработчик, компания Zhipu AI, позиционирует его как инструмент для превращения текстовых подсказок в видеоролики. Модель также упоминается в связке с генерацией видео из изображений, хотя основная задача в паспорте обозначена как text-to-video.

Что умеет

Авторы описывают CogVideoX как систему для генерации видео по тексту и изображению. В репозитории проект помечен метками text-to-video и image-to-video, что указывает на два режима работы. Среди ключевых слов также значатся llm и sora — это даёт понять, что в основе лежат языковые модели, а сама технология относится к классу решений, аналогичных Sora. Подробностей о максимальной длительности ролика или поддерживаемых разрешениях в паспорте нет.

Что нужно для запуска

Код написан на Python и распространяется по лицензии Apache-2.0. Веса модели имеют иную лицензию — other. Для работы потребуется видеокарта NVIDIA с поддержкой CUDA. Дословно из описания авторов: устройства с NVIDIA H100 и выше, требуется установка пакетов torch и torchao из исходного кода. Рекомендуемая версия CUDA — 12.4. Самый большой файл весов занимает 9,2 ГБ, а полный объём всех файлов — 20 ГБ. Модель интегрирована в библиотеку diffusers. Локальный запуск возможен, но требования к оборудованию весьма специфичны.

Кому подойдёт

Инструмент рассчитан на разработчиков и исследователей, у которых есть доступ к мощным серверным ускорителям. Открытый код и наличие репозитория на GitHub позволяют изучать архитектуру и дорабатывать модель под свои задачи. Для бытового использования на пользовательских видеокартах CogVideoX, судя по заявленным требованиям, не предназначен. Тем, кто ищет облачный сервис без необходимости настройки окружения, также стоит присмотреться к другим решениям — здесь потребуется ручная сборка зависимостей и работа с Python-кодом.

Модель продолжает развиваться: последнее изменение кода датировано ноябрём 2025 года, а последний выпуск обозначен как v1.0. Это говорит о том, что проект находится в активной фазе поддержки, но пока не обзавёлся массой промежуточных релизов.

Конвейер CogVideoX Генерация видео по тексту и изображению ВХОД Текстовое описание Изображение Промпт и опорный кадр КОДИРОВАНИЕ Токенизация Эмбеддинги Текст и кадр в векторы ГЕНЕРАЦИЯ CogVideoX-5b Диффузия Шумоподавление, кадры ДЕКОДИРОВАНИЕ VAE-декодер Сборка кадров Латентный код в видео РЕЗУЛЬТАТ Видеофайл Формат: MP4 Сгенерированное видео Режимы работы: Text-to-Video Image-to-Video Платформа: CUDA 12.4 Библиотека: diffusers Лицензия: Apache-2.0 Веса: 20 ГБ
Как устроен конвейер CogVideoX. Схема нарисована по паспорту инструмента.

Паспорт

Задачаtext-to-video источник
Лицензия кодаApache-2.0 источник
Лицензия весовother источник
ПлатформаCUDA по описанию автора источник
Самый большой файл весов9.2 ГБ источник
Все файлы весов20 ГБ источник
Библиотекаdiffusers источник
ЯзыкPython источник
Последнее изменение кода2025-11-04 источник
Репозиторий создан2022-05-29 источник
Меняется часто — данные на 09.08.2026
Последний выпускv1.0 источник
Дата выпуска2024-11-08 источник
Звёзд на GitHub12929 источник
Форков1324 источник
Загрузок за месяц15821 источник
Обновление модели2024-11-23 источник

Значения собраны автоматически из официальных источников и проверены 09.08.2026. У каждого есть ссылка на источник, а у собранных со страницы разработчика — ещё и дословная цитата: наведите на пометку. Тарифы и версии показаны на дату проверки и меняются чаще всего — перед покупкой сверьтесь с сайтом.

Смотрите также