CPU3DИИ-инструменты для 3D, видео и звука

Iris-3B: новая text-to-image модель генерирует пиксели напрямую, без VAE

На HuggingFace опубликована модель speridlabs/iris-3b — text-to-image генератор с 3 млрд параметров. Отличие от большинства генераторов в том, что Iris-3B работает в пиксельном пространстве: сеть сама выводит каждый пиксель изображения 1024x1024, минуя VAE и латентное пространство. Автор также сообщает, что после дообучения та же модель решает задачи монокулярной оценки глубины, реставрации и апскейла изображений.

Что это значит

Модель распространяется по лицензии apache-2.0, веса выложены в формате safetensors. Самый большой файл — depth/model.safetensors — весит 11.1 ГБ, суммарно в репозитории 33.5 ГБ. Запускается через pytorch. Для генерации одного изображения автор рекомендует CFG 3 и 100 шагов. Требования к видеопамяти разработчик не уточняет, квантованных сборок в репозитории нет. Полные веса в 33.5 ГБ — это заметная нагрузка для локального запуска, и без сведений о минимальной конфигурации оценить, заведётся ли модель на конкретной карте, сложно. Следить за появлением новых ИИ-инструментов для 3D и видео можно в ленте CPU3D.
Iris-3B: text-to-image без VAE Прямая генерация пикселей 1024x1024 Текстовый промпт описание сцены Iris-3B 3 млрд параметров CFG 3, 100 шагов Пиксели 1024x1024 напрямую Изображение без VAE, без латентного пространства Дообучение глубина, реставрация, апскейл 33.5 ГБ safetensors apache-2.0, pytorch VAE не используется
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также