Mochi 1: генератор видео — что умеет и что нужно для запуска

Mochi 1 — это генератор видео по текстовому описанию (text-to-video) с открытым исходным кодом, созданный компанией Genmo. Инструмент предназначен для синтеза видеороликов на основе подсказок и доступен для локального запуска и дообучения.
Что умеет
Авторы описывают модель как одну из лучших среди открытых решений для генерации видео. Основная задача — создание видео на основе текстового описания. Разработчики предоставляют инструмент для тонкой настройки (LoRA) на собственных видеоданных, что позволяет адаптировать модель под специфические стили или объекты.
Что нужно для запуска
Код написан на Python и распространяется под лицензией Apache-2.0. Веса модели также доступны под лицензией Apache-2.0. Для работы используется библиотека diffusers. Полный набор файлов весов занимает 124.3 ГБ, самый крупный файл — 37.4 ГБ.
По описанию автора, для запуска и дообучения требуется графический процессор с объёмом видеопамяти 80 ГБ, в качестве примеров указаны ускорители H100 или A100. Локальный запуск на менее мощном оборудовании авторы не описывают.
Исходный код доступен в репозитории: github.com/genmoai/mochi. Веса модели размещены по адресу: huggingface.co/genmo/mochi-1-preview.
Кому подойдёт
Инструмент ориентирован на исследователей и разработчиков, у которых есть доступ к серверным GPU с большим объёмом памяти. Возможность дообучения делает его интересным для тех, кто работает с авторскими наборами видеоданных и хочет адаптировать модель под узкие задачи.
Пользователям с потребительскими видеокартами Mochi 1, скорее всего, не подойдёт: требования к видеопамяти, заявленные разработчиками, существенно превышают возможности массовых GPU. Для быстрой генерации видео без собственной инфраструктуры инструмент также не предназначен — облачной версии авторы не указывают.
Mochi 1 предлагает исследовательскому сообществу открытую кодовую базу и веса для задач синтеза видео. Высокий порог по видеопамяти ограничивает круг пользователей, но даёт пространство для экспериментов с дообучением на специализированном оборудовании.
Паспорт
Репозиторий · Модель на HuggingFace
| Задача | text-to-video источник |
|---|---|
| Лицензия кода | Apache-2.0 источник |
| Лицензия весов | apache-2.0 источник |
| Видеопамять | 80 ГБ по описанию автора источник |
| Самый большой файл весов | 37.4 ГБ источник |
| Все файлы весов | 124.3 ГБ источник |
| Библиотека | diffusers источник |
| Язык | Python источник |
| Последнее изменение кода | 2025-11-14 источник |
| Репозиторий создан | 2024-09-11 источник |
| Звёзд на GitHub | 3704 источник |
|---|---|
| Форков | 489 источник |
| Загрузок за месяц | 4605 источник |
| Обновление модели | 2025-09-04 источник |
Значения собраны автоматически из официальных источников и проверены 03.08.2026. Цен и лимитов тарифов в паспорте нет: они меняются чаще, чем обновляется страница — смотрите официальный сайт.



