首页 /文章 /Qwen-Image-2.1 的开源图像生成能力 透明图层、编辑与本地门槛

Qwen-Image-2.1 的开源图像生成能力 透明图层、编辑与本地门槛

Qwen-Image-2.1(2026-09-20 发布)的能力评测、与闭源对比的领先幅度、本地显存门槛与 Qwen 许可证对商用的限制。

图像生成开源模型Qwen2026Q3
分类:大模型专题 › 模型能力与范式 发布于 2026-09-21 53 次浏览

一 这次更新了什么

阿里千问团队 9 月 20 日开源 Qwen-Image-2.1,把文生图与图像编辑整合进同一个模型。视觉生成部分 7B 参数(32 层 Single-Stream DiT),原生支持 2K 输出;如果算上文本编码器,整个管线约 16.22B 参数。

和上一代相比,这次改了四处:

  • 原生透明图——模型根据提示词自己决定输出普通图还是带 alpha 通道的 RGBA 图,不需要再单独跑一遍抠图。
  • 生成与编辑统一——文生图、透明图层编辑、从照片提取主体,三种任务在同一个模型里完成。
  • 多图参考——参考图上限提到 10 张,可以合成合照、生成整套穿搭、参考多张家装图出方案。
  • 局部编辑——支持圈选、涂抹、独立掩码三种方式,一次可以指定多个区域分别修改。

推理侧用了一套混合粒度注意力:文本部分(系统前缀、编辑指令)走 token 级因果掩码,图像生成部分走 chunk 级掩码,配合 KV Cache 复用把输入图和指令作为静态上下文在首步预计算。官方说法是这能在多图输入场景下兼顾速度与显存。

二 评测:第一名的含金量

官方在 Qwen-Image-Bench 上给出 60.28 的总分,位列开源模型第一。把它和几个闭源模型放在一起看:

模型Qwen-Image-Bench 总分开源
Qwen-Image-2.160.28是
Nano Banana 2.059.82否
GPT Image 1.559.65否

有一个数字要单独说清楚:第一名领先第二名 0.46 分。在这个量级上,0.46 分属于统计噪声范围内的差距,不足以支撑"全面超越"的说法。它更准确的含义是:一个 7B 的开源模型,在总分维度上追平了这一档闭源模型,不再有明显代差。

另外要看对手是谁。Nano Banana 2.0 和 GPT Image 1.5 都不是各自厂商的最强型号——榜单里没有出现更高端的闭源模型。所以"7B 超过闭源"这个说法成立,但它的边界是"超过了这一档闭源",不是"超过了最强的闭源"。

三 许可证:这次收紧了

这是本次发布中最需要留意的一条,也是各家媒体标题里最容易被略过的一条。

Qwen-Image-2.1 采用的是 Qwen Research License Agreement,不是上一代图像模型使用的宽松协议。协议原文(2026 年 9 月 20 日版)第 2 条写得很直接:

You are granted a non-exclusive, worldwide, non-transferable and
royalty-free limited license ... to use, reproduce, distribute, copy,
create derivative works of, and make modifications to the Materials
FOR NON-COMMERCIAL PURPOSES ONLY.

You shall not use the Materials for any commercial purpose without
obtaining a separate commercial license from us.

也就是说:研究 / 评估用途可以无费用使用;商用前需单独申请授权。协议同时要求,如果用它的输出训练或改进其他模型,要在产品文档里注明 "Built with Qwen" 或 "Improved using Qwen";且不能把 "Qwen" 作为衍生作品的主名称。

这条限制对个人学习没有任何影响,但对打算把它接进线上产品的团队,是需要提前规划的:要么走官方商用授权流程,要么把图像能力换到商用条款更宽松的模型上。后面这种情况,意味着前面那些能力的收益要重新评估。

四 本地跑要什么配置

官方仓库没有给出显存门槛的明确数字,只提供了显存优化的调用方式。这里按参数量和实际推理路径推算,供参考:

  • BF16 全精度——16.22B 参数约需 32GB 显存存放权重,加上推理时的激活值与 KV Cache,48GB 显存更稳妥。这一档需要 A6000 / RTX 6000 Ada 级别的卡。
  • 消费级 24GB——权重装不满,需要开量化或显存卸载。官方 README 提供的 enable_model_cpu_offload() 就是把暂时不用的模块挪到内存,代价是速度下降。
  • 纯 CPU 或 16GB 以下——权重放不下,需要 GGUF 量化版本,速度以分钟计。

官方 README 给出的显存优化写法:

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()

要注意的是,2K 原生输出和 10 张参考图都是显存大户:参考图越多、分辨率越高,KV Cache 占用越大。多图编辑场景建议先按单图跑通,再逐步加压。

五 透明图层解决了什么

透明图是这次最实用的一项能力,因为它直接砍掉了工作流里的一环。

做过电商主图、表情包、App 图标的人对这条流水线不陌生:生成图 → 导入 PS → 魔棒选区 → 修边缘 → 导出 PNG。透明图能力把中间三步合成一步,模型直接输出 RGBA 图层。

更值得注意的是它处理边缘的方式。传统抠图最头疼的是毛发、纱质、半透明材质这类边缘——像素本身是前景和背景的混合,魔棒和钢笔都很难切干净。这个模型是从 RGB 照片直接提取主体并输出 alpha 通道,边缘的判定在生成阶段完成,而不是事后在像素上做分割。这也是它和"先生成再抠图"路线最本质的差别。

此外,透明图层里的文字和人物表情都可以直接编辑——意味着一次生成的素材可以反复调整,不用每改一处就重新出图。

六 参考链接

关键词 图像生成开源模型Qwen2026Q3 000025