Qwen-Image-2.1 вышла на HuggingFace: генерация и редактирование изображений на 7B-модели
На HuggingFace опубликована модель unsloth/Qwen-Image-2.1 — unified-модель для генерации изображений по тексту и редактирования. Дата публикации — 23 сентября 2026 года. Модель поддерживает до 10 референсных изображений, локальное редактирование через маски и аннотации, генерацию прозрачных RGBA-изображений и извлечение объектов с фотографий.
Что это значит
Визуальная часть модели содержит 7,1 млрд параметров, архитектура — DiT с 32 Single-Stream слоями. Самый большой файл весов занимает 9,3 ГБ, всего в репозитории 30,8 ГБ в формате safetensors. Запускается через diffusers.
Лицензия — Qwen RESEARCH LICENSE AGREEMENT: только некоммерческое использование. Модель можно применять, изменять и распространять для исследований или оценки. Для коммерческого применения нужна отдельная лицензия от правообладателя. При распространении требуется приложить копию лицензии, сохранить уведомление об авторстве и отметить изменения. Если модель используется для обучения другой ИИ-модели, в документации нужно указать «Built with Qwen» или «Improved using Qwen».
Требования к видеопамяти разработчик в карточке модели не уточняет. Для локального запуска доступны полные веса в safetensors, квантованных сборок в репозитории нет.
Модель ориентирована на исследовательское применение и локальные эксперименты с генерацией и редактированием изображений. Больше новостей об ИИ-инструментах для 3D и видео — в ленте CPU3D.Как устроен метод. Схема нарисована по этой заметке.