CPU3DИИ-инструменты для 3D, видео и звука

H3-World: интерактивная image-to-video модель на базе MiniMax-H3

На HuggingFace опубликована модель DANNY621/H3-World с задачей image-to-video. Автор описывает её как первую интерактивную модель мира на основе MiniMax-H3: по начальному кадру и клавиатурным командам она генерирует видео с согласованным движением персонажа и камеры. Модель выпущена под лицензией apache-2.0, самый большой файл весов — step-10000.safetensors размером 0.1 ГБ, форматы весов — safetensors. Чекпоинт представляет собой LoRA-надстройку на 65.6M параметров поверх базовой модели MiniMax-H3 и требует её весов и патча направленного внимания для работы.

Что это значит

В нашем справочнике по генераторам видео есть несколько открытых image-to-video и text-to-video моделей, с которыми можно сравнить новинку. LTX-Video от Lightricks — генератор видео с задачей image-to-video, открытым кодом под Apache-2.0 и самым большим файлом весов 26.6 ГБ. Авторы заявляют потребность всего в 1 ГБ видеопамяти и поддержку MPS на macOS. H3-World на этом фоне выглядит заметно легче по весам: её LoRA-файл занимает 0.1 ГБ, но для запуска всё равно нужна базовая модель MiniMax-H3, вес которой в паспорте H3-World не указан. CogVideoX от Zhipu AI решает задачу text-to-video, имеет открытый код под Apache-2.0 и самый большой файл весов 9.2 ГБ. Платформа по описанию автора — CUDA. H3-World отличается от неё и по задаче (image-to-video с управлением), и по подходу: вместо полной модели — LoRA-надстройка поверх сторонней базы. Pyramid Flow — text-to-video генератор с открытым кодом под MIT, самым большим файлом весов 7.8 ГБ и заявленной работой менее чем на 8 ГБ видеопамяти. Как и CogVideoX, это полноценная модель, тогда как H3-World — параметроэффективная надстройка. H3-World выделяется не размером, а подходом: интерактивное управление генерацией через клавиатурные команды и привязка инструкций к латентным интервалам через направленное внимание. Для практического использования потребуется базовая модель MiniMax-H3 и официальный репозиторий с патчем — без них LoRA-чекпоинт не воспроизведёт заявленное поведение.
H3-World: интерактивная image-to-video модель LoRA-надстройка поверх MiniMax-H3 с управлением через клавиатуру Вход начальный кадр команды LoRA-надстройка LoRA 65.6M параметров файл 0.1 ГБ Базовая модель H3 MiniMax-H3 вес не указан Патч направ- ленного внимания Генерация видео согласованное движение персонажа и камеры Выход видео с управлением по клавиатурным командам Сравнение: LTX-Video — 26.6 ГБ CogVideoX — 9.2 ГБ Pyramid Flow — 7.8 ГБ H3-World — 0.1 ГБ (LoRA)
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также