SupraLabs выпустила компактную text-to-image модель Supra2-IMG
На HuggingFace опубликована модель SupraLabs/Supra2-IMG — diffusion transformer для генерации изображений по текстовому описанию. Автор называет её крошечной: около 100 млн параметров, обучение с нуля на синтетических данных, разрешение выхода 256x256.
Что это значит
Самый большой файл весов — model_final_ema.pt — занимает 0.4 ГБ, что заметно меньше типичных text-to-image моделей. Лицензия apache-2.0 разрешает свободное использование и модификацию. Запускается модель через transformers, веса выложены в формате pt. Архитектура — diffusion transformer с замороженным энкодером Flan-T5-Base и VAE от Stability AI. Точных требований к видеопамяти разработчик не указывает, но при 104 млн параметров и файле весов в 0.4 ГБ модель должна помещаться в скромные по современным меркам объёмы VRAM.
Модель обучена на 5.6 млн изображений из датасета FLUX-Reason-6M в течение 10 эпох на одной H100. Для тех, кто ищет лёгкий text-to-image инструмент для экспериментов на своём железе, это один из самых компактных вариантов среди diffusion transformer. Следить за появлением подобных моделей можно в ленте новостей об ИИ-инструментах.Как устроен метод. Схема нарисована по этой заметке.