CPU3D3D、视频与音频的 AI 工具

SupraLabs 发布紧凑型 text-to-image 模型 Supra2-IMG

HuggingFace 上发布了模型 SupraLabs/Supra2-IMG —— 一个用于根据文本描述生成图像的 diffusion transformer。作者称其极小:约 1 亿参数,从零开始在合成数据上训练,输出分辨率为 256x256。

这意味着什么

最大的权重文件 model_final_ema.pt 占用 0.4 GB,明显小于典型的 text-to-image 模型。apache-2.0 许可证允许自由使用和修改。模型通过 transformers 启动,权重以 pt 格式发布。架构为 diffusion transformer,搭配冻结的 Flan-T5-Base 编码器和 Stability AI 的 VAE。开发者未指明具体的显存要求,但在 104 百万参数和 0.4 GB 权重文件的情况下,该模型应当能装入按现代标准而言相当有限的 VRAM 容量中。 该模型在 FLUX-Reason-6M 数据集的 560 万张图像上训练了 10 个 epoch,使用单张 H100。对于寻找轻量级 text-to-image 工具以便在自己的硬件上做实验的人来说,这是 diffusion transformer 中最紧凑的选项之一。可以在AI 工具动态中关注此类模型的出现。
Supra2-IMG — 紧凑型 text-to-image 模型 diffusion transformer · 104 百万参数 · 256x256 文本描述 输入提示词 Flan-T5-Base 冻结编码器 Diffusion Transformer 104 百万参数 VAE Stability AI 图像 256x256 生成结果 训练 从零在合成数据上 来自 FLUX-Reason-6M 的 5.6 百万 10 轮 · 一块 H100 模型权重 model_final_ema.pt 0.4 GB · apache-2.0 格式 pt · transformers 紧凑型 diffusion transformer,适合在普通硬件上实验
该方法的构造。示意图根据这篇简讯绘制。

相关阅读