Iris-3B: новая text-to-image модель генерирует пиксели напрямую, без VAE
На HuggingFace опубликована модель speridlabs/iris-3b — text-to-image генератор с 3 млрд параметров. Отличие от большинства генераторов в том, что Iris-3B работает в пиксельном пространстве: сеть сама выводит каждый пиксель изображения 1024x1024, минуя VAE и латентное пространство. Автор также сообщает, что после дообучения та же модель решает задачи монокулярной оценки глубины, реставрации и апскейла изображений.
Что это значит
Модель распространяется по лицензии apache-2.0, веса выложены в формате safetensors. Самый большой файл — depth/model.safetensors — весит 11.1 ГБ, суммарно в репозитории 33.5 ГБ. Запускается через pytorch. Для генерации одного изображения автор рекомендует CFG 3 и 100 шагов.
Требования к видеопамяти разработчик не уточняет, квантованных сборок в репозитории нет. Полные веса в 33.5 ГБ — это заметная нагрузка для локального запуска, и без сведений о минимальной конфигурации оценить, заведётся ли модель на конкретной карте, сложно.
Следить за появлением новых ИИ-инструментов для 3D и видео можно в ленте CPU3D.Как устроен метод. Схема нарисована по этой заметке.