H3-World: интерактивная image-to-video модель на базе MiniMax-H3
На HuggingFace опубликована модель DANNY621/H3-World с задачей image-to-video. Автор описывает её как первую интерактивную модель мира на основе MiniMax-H3: по начальному кадру и клавиатурным командам она генерирует видео с согласованным движением персонажа и камеры. Модель выпущена под лицензией apache-2.0, самый большой файл весов — step-10000.safetensors размером 0.1 ГБ, форматы весов — safetensors. Чекпоинт представляет собой LoRA-надстройку на 65.6M параметров поверх базовой модели MiniMax-H3 и требует её весов и патча направленного внимания для работы.
Что это значит
В нашем справочнике по генераторам видео есть несколько открытых image-to-video и text-to-video моделей, с которыми можно сравнить новинку.
LTX-Video от Lightricks — генератор видео с задачей image-to-video, открытым кодом под Apache-2.0 и самым большим файлом весов 26.6 ГБ. Авторы заявляют потребность всего в 1 ГБ видеопамяти и поддержку MPS на macOS. H3-World на этом фоне выглядит заметно легче по весам: её LoRA-файл занимает 0.1 ГБ, но для запуска всё равно нужна базовая модель MiniMax-H3, вес которой в паспорте H3-World не указан.
CogVideoX от Zhipu AI решает задачу text-to-video, имеет открытый код под Apache-2.0 и самый большой файл весов 9.2 ГБ. Платформа по описанию автора — CUDA. H3-World отличается от неё и по задаче (image-to-video с управлением), и по подходу: вместо полной модели — LoRA-надстройка поверх сторонней базы.
Pyramid Flow — text-to-video генератор с открытым кодом под MIT, самым большим файлом весов 7.8 ГБ и заявленной работой менее чем на 8 ГБ видеопамяти. Как и CogVideoX, это полноценная модель, тогда как H3-World — параметроэффективная надстройка.
H3-World выделяется не размером, а подходом: интерактивное управление генерацией через клавиатурные команды и привязка инструкций к латентным интервалам через направленное внимание. Для практического использования потребуется базовая модель MiniMax-H3 и официальный репозиторий с патчем — без них LoRA-чекпоинт не воспроизведёт заявленное поведение.Как устроен метод. Схема нарисована по этой заметке.