一 这次更新了什么
阿里千问团队 9 月 20 日开源 Qwen-Image-2.1,把文生图与图像编辑整合进同一个模型。视觉生成部分 7B 参数(32 层 Single-Stream DiT),原生支持 2K 输出;如果算上文本编码器,整个管线约 16.22B 参数。
和上一代相比,这次改了四处:
- 原生透明图——模型根据提示词自己决定输出普通图还是带 alpha 通道的 RGBA 图,不需要再单独跑一遍抠图。
- 生成与编辑统一——文生图、透明图层编辑、从照片提取主体,三种任务在同一个模型里完成。
- 多图参考——参考图上限提到 10 张,可以合成合照、生成整套穿搭、参考多张家装图出方案。
- 局部编辑——支持圈选、涂抹、独立掩码三种方式,一次可以指定多个区域分别修改。
推理侧用了一套混合粒度注意力:文本部分(系统前缀、编辑指令)走 token 级因果掩码,图像生成部分走 chunk 级掩码,配合 KV Cache 复用把输入图和指令作为静态上下文在首步预计算。官方说法是这能在多图输入场景下兼顾速度与显存。
二 评测:第一名的含金量
官方在 Qwen-Image-Bench 上给出 60.28 的总分,位列开源模型第一。把它和几个闭源模型放在一起看:
| 模型 | Qwen-Image-Bench 总分 | 开源 |
| Qwen-Image-2.1 | 60.28 | 是 |
| Nano Banana 2.0 | 59.82 | 否 |
| GPT Image 1.5 | 59.65 | 否 |
有一个数字要单独说清楚:第一名领先第二名 0.46 分。在这个量级上,0.46 分属于统计噪声范围内的差距,不足以支撑"全面超越"的说法。它更准确的含义是:一个 7B 的开源模型,在总分维度上追平了这一档闭源模型,不再有明显代差。
另外要看对手是谁。Nano Banana 2.0 和 GPT Image 1.5 都不是各自厂商的最强型号——榜单里没有出现更高端的闭源模型。所以"7B 超过闭源"这个说法成立,但它的边界是"超过了这一档闭源",不是"超过了最强的闭源"。
三 许可证:这次收紧了
这是本次发布中最需要留意的一条,也是各家媒体标题里最容易被略过的一条。
Qwen-Image-2.1 采用的是 Qwen Research License Agreement,不是上一代图像模型使用的宽松协议。协议原文(2026 年 9 月 20 日版)第 2 条写得很直接:
You are granted a non-exclusive, worldwide, non-transferable and
royalty-free limited license ... to use, reproduce, distribute, copy,
create derivative works of, and make modifications to the Materials
FOR NON-COMMERCIAL PURPOSES ONLY.
You shall not use the Materials for any commercial purpose without
obtaining a separate commercial license from us.
也就是说:研究 / 评估用途可以无费用使用;商用前需单独申请授权。协议同时要求,如果用它的输出训练或改进其他模型,要在产品文档里注明 "Built with Qwen" 或 "Improved using Qwen";且不能把 "Qwen" 作为衍生作品的主名称。
这条限制对个人学习没有任何影响,但对打算把它接进线上产品的团队,是需要提前规划的:要么走官方商用授权流程,要么把图像能力换到商用条款更宽松的模型上。后面这种情况,意味着前面那些能力的收益要重新评估。
四 本地跑要什么配置
官方仓库没有给出显存门槛的明确数字,只提供了显存优化的调用方式。这里按参数量和实际推理路径推算,供参考:
- BF16 全精度——16.22B 参数约需 32GB 显存存放权重,加上推理时的激活值与 KV Cache,48GB 显存更稳妥。这一档需要 A6000 / RTX 6000 Ada 级别的卡。
- 消费级 24GB——权重装不满,需要开量化或显存卸载。官方 README 提供的
enable_model_cpu_offload() 就是把暂时不用的模块挪到内存,代价是速度下降。
- 纯 CPU 或 16GB 以下——权重放不下,需要 GGUF 量化版本,速度以分钟计。
官方 README 给出的显存优化写法:
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()
要注意的是,2K 原生输出和 10 张参考图都是显存大户:参考图越多、分辨率越高,KV Cache 占用越大。多图编辑场景建议先按单图跑通,再逐步加压。
五 透明图层解决了什么
透明图是这次最实用的一项能力,因为它直接砍掉了工作流里的一环。
做过电商主图、表情包、App 图标的人对这条流水线不陌生:生成图 → 导入 PS → 魔棒选区 → 修边缘 → 导出 PNG。透明图能力把中间三步合成一步,模型直接输出 RGBA 图层。
更值得注意的是它处理边缘的方式。传统抠图最头疼的是毛发、纱质、半透明材质这类边缘——像素本身是前景和背景的混合,魔棒和钢笔都很难切干净。这个模型是从 RGB 照片直接提取主体并输出 alpha 通道,边缘的判定在生成阶段完成,而不是事后在像素上做分割。这也是它和"先生成再抠图"路线最本质的差别。
此外,透明图层里的文字和人物表情都可以直接编辑——意味着一次生成的素材可以反复调整,不用每改一处就重新出图。