CPU3D3D、视频与音频的 AI 工具

Qwen-Image-2.1 已在 HuggingFace 发布:基于 7B 模型的图像生成与编辑

HuggingFace 上发布了模型 unsloth/Qwen-Image-2.1 —— 一款用于文本生成图像和编辑的统一模型。发布日期为 2026 年 9 月 23 日。该模型支持最多 10 张参考图像、通过蒙版和标注进行局部编辑、生成透明 RGBA 图像,以及从照片中提取对象。

这意味着什么

模型的视觉部分包含 71 亿参数,架构为具有 32 个 Single-Stream 层的 DiT。最大的权重文件占用 9.3 GB,仓库中 safetensors 格式总计 30.8 GB。通过 diffusers 启动。 许可证为 Qwen RESEARCH LICENSE AGREEMENT:仅限非商业使用。该模型可用于研究或评估目的的使用、修改和分发。商业应用需要获得权利人的单独许可。分发时需附上许可证副本、保留署名声明并标注修改。如果该模型被用于训练其他 AI 模型,则需在文档中注明「Built with Qwen」或「Improved using Qwen」。 开发者未在模型页面中说明显存要求。本地运行可使用 safetensors 格式的完整权重,仓库中没有量化版本。 该模型面向研究用途以及图像生成与编辑的本地实验。更多关于 3D 和视频 AI 工具的新闻——请见 CPU3D 动态。
Qwen(通义千问)-Image-2.1:图像生成与编辑 统一模型 7,1 亿参数 · DiT · 32 个 Single-Stream 层 输入 文本 + 最多 10 个参考 模型 DiT · 32 层 · 7,1B 输出 RGBA · 蒙版 · 对象 功能 文本生成 局部编辑 透明 RGBA 对象提取 技术细节 权重:9,3 GB(最大)· 共 30,8 GB 格式:safetensors · 通过 diffusers 运行 无量化版本 许可证 Qwen RESEARCH LICENSE 仅限非商业使用 商业用途需单独许可
方法的结构。示意图根据本简讯绘制。

相关阅读