CPU3DИИ-инструменты для 3D и видео

Latte: генератор видео — что умеет и что нужно для запуска

Latte — это генератор видео с открытым кодом, построенный на архитектуре Latent Diffusion Transformer. Разработчики позиционируют его как исследовательский инструмент для синтеза видео по текстовому описанию, опубликованный в рамках конференции TMLR 2025.

Что умеет

  • Генерирует видео на основе текстового описания (text-to-video).
  • Использует подход Latent Diffusion Transformer — работу со скрытым представлением кадров вместо попиксельной генерации.
  • Авторы предоставляют предобученные модели, доступные для скачивания и локального запуска.
  • Код открыт под лицензией Apache-2.0, что разрешает использование и модификацию в коммерческих и некоммерческих проектах.

Что нужно для запуска

  • Платформа: по описанию авторов, для работы требуется CUDA. При этом в документации указано, что для запуска предобученных моделей локально на центральном процессоре можно убрать зависимости cudatoolkit и pytorch-cuda из файла требований.
  • Язык: Python.
  • Лицензия: Apache-2.0.
  • Репозиторий: github.com/Vchitect/Latte.
  • Актуальность: последнее изменение кода зафиксировано 30 октября 2025 года.

Кому подойдёт

Инструмент рассчитан в первую очередь на исследователей и разработчиков, знакомых с Python и экосистемой PyTorch. Открытый код и лицензия Apache-2.0 делают его удобной базой для экспериментов с видео-диффузией, дообучения моделей или встраивания в собственные пайплайны. Возможность запуска на CPU, пусть и с оговорками, снижает порог входа для тех, у кого нет мощного GPU.

Тем, кто ищет готовое приложение с графическим интерфейсом или облачный сервис без настройки окружения, Latte не подойдёт — это именно кодовая база для локального развёртывания.

Авторы не указывают конкретных требований к объёму видеопамяти или оперативной памяти, поэтому перед запуском стоит ориентироваться на типичные для диффузионных моделей аппетиты и тестировать на своём оборудовании.

Конвейер Latte — генератор видео Текстовое описание (промпт) Кодирование текста (T5) Latent Diffusion Transformer (DiT) Декодирование в видео (VAE) Видео файл Платформа: CUDA (возможен запуск на CPU) Лицензия: Apache-2.0 Репозиторий: github.com/Vchitect/Latte Разработчик: Vchitect
Как устроен конвейер Latte. Схема нарисована по паспорту инструмента.

Паспорт

Лицензия кодаApache-2.0 источник
Платформаcuda по описанию автора источник
ЯзыкPython источник
Последнее изменение кода2025-10-30 источник
Репозиторий создан2023-10-28 источник
Меняется часто — данные на 03.08.2026
Звёзд на GitHub1948 источник
Форков192 источник

Значения собраны автоматически из официальных источников и проверены 03.08.2026. Цен и лимитов тарифов в паспорте нет: они меняются чаще, чем обновляется страница — смотрите официальный сайт.

Смотрите также