CPU3DИИ-инструменты для 3D, видео и звука

WorldCrafter-Base от TencentARC: модель image-to-video на 14,3 млрд параметров

На HuggingFace 21 сентября 2026 года опубликована модель TencentARC/WorldCrafter-Base с задачей image-to-video. Это базовая часть проекта WorldCrafter: веса transformer, камера-адаптер и LoRA для inference-кода. Репозиторий содержит 55,4 ГБ весов в форматах pth и safetensors, самый большой файл — 9,3 ГБ. Запускается через diffusers. Автор выложил код в открытый доступ, но лицензию модели на странице не указал.

Что это значит

Модель на 14,3 млрд параметров — заметно тяжелее того, что уже есть в нашем разделе генераторов видео. Для сравнения: LTX-Video от Lightricks решает ту же задачу image-to-video и по описанию автора требует всего 1 ГБ видеопамяти, а весь репозиторий весит 236,4 ГБ. У WorldCrafter-Base только базовая часть занимает 55,4 ГБ, и это без учёта общих компонентов из WorldCrafter-Fast — repencoder, text_encoder, tokenizer, vae и scheduler, которые лежат в соседнем репозитории. Требования к видеопамяти TencentARC не публикует. Для сравнения, Maestro от Blizaine указывает диапазон 12—24 ГБ, но это другой класс инструмента — полноценная студия на базе WanGP с image-text-to-video. У CogVideoX от Zhipu AI задача text-to-video, а не image-to-video, и веса занимают 20 ГБ. Пока у модели ноль загрузок, и автор не приводит ни требований к железу, ни условий лицензии. Для локального запуска понадобится не только этот репозиторий, но и WorldCrafter-Fast с общими компонентами — самостоятельной сборкой модель не является.
WorldCrafter-Base от TencentARC image-to-video, 14,3 млрд параметров Изображение входной кадр image-to-video WorldCrafter-Base базовая часть проекта веса transformer камера-адаптер LoRA для inference Видео сгенерированный ролик WorldCrafter-Fast общие компоненты repencoder, text_encoder tokenizer, vae, scheduler 55,4 ГБ весов pth и safetensors файл до 9,3 ГБ Запуск через diffusers локально Сравнение: LTX-Video — 1 ГБ видеопамяти, 236,4 ГБ репозиторий CogVideoX — 20 ГБ весов, text-to-video Maestro — 12—24 ГБ, студия
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также