WorldCrafter-Base от TencentARC: модель image-to-video на 14,3 млрд параметров
На HuggingFace 21 сентября 2026 года опубликована модель TencentARC/WorldCrafter-Base с задачей image-to-video. Это базовая часть проекта WorldCrafter: веса transformer, камера-адаптер и LoRA для inference-кода. Репозиторий содержит 55,4 ГБ весов в форматах pth и safetensors, самый большой файл — 9,3 ГБ. Запускается через diffusers. Автор выложил код в открытый доступ, но лицензию модели на странице не указал.
Что это значит
Модель на 14,3 млрд параметров — заметно тяжелее того, что уже есть в нашем разделе генераторов видео. Для сравнения: LTX-Video от Lightricks решает ту же задачу image-to-video и по описанию автора требует всего 1 ГБ видеопамяти, а весь репозиторий весит 236,4 ГБ. У WorldCrafter-Base только базовая часть занимает 55,4 ГБ, и это без учёта общих компонентов из WorldCrafter-Fast — repencoder, text_encoder, tokenizer, vae и scheduler, которые лежат в соседнем репозитории.
Требования к видеопамяти TencentARC не публикует. Для сравнения, Maestro от Blizaine указывает диапазон 12—24 ГБ, но это другой класс инструмента — полноценная студия на базе WanGP с image-text-to-video. У CogVideoX от Zhipu AI задача text-to-video, а не image-to-video, и веса занимают 20 ГБ.
Пока у модели ноль загрузок, и автор не приводит ни требований к железу, ни условий лицензии. Для локального запуска понадобится не только этот репозиторий, но и WorldCrafter-Fast с общими компонентами — самостоятельной сборкой модель не является.Как устроен метод. Схема нарисована по этой заметке.