Minimax-H3-fl2va-ref2va-hybrid-models: новая text-to-video модель на HuggingFace
На HuggingFace 11 августа 2026 года опубликована модель smhfacct/Minimax-H3-fl2va-ref2va-hybrid-models с задачей text-to-video. На момент публикации у модели ноль загрузок и 27 отметок «нравится». Разработчик не уточняет ни архитектуру, ни требования к оборудованию, ни формат выходных файлов.
Что это значит
Модель относится к генерации видео по текстовому описанию, то есть к направлению text-to-video. В нашем справочнике ИИ-инструментов для 3D и видео сейчас нет ни одной модели с задачей text-to-video — все представленные генераторы работают по изображению: OpenLRM, Hunyuan3D 2.1 и TRELLIS решают задачу image-to-3d. Прямого пересечения по задаче с новой моделью нет.
По косвенным признакам сравнение тоже затруднено: у всех трёх наших инструментов открытый код и опубликованные веса, тогда как по Minimax-H3-fl2va-ref2va-hybrid-models разработчик не уточняет ни лицензию, ни открытость кода, ни размер файлов. Пока модель не набрала загрузок и не появилось документации, оценить её место среди инструментов справочника невозможно.
Если модель окажется рабочей и получит описание требований, её можно будет рассмотреть как кандидата на добавление в раздел text-to-video — сейчас это направление в справочнике не покрыто.Как устроен метод. Схема нарисована по этой заметке.