
图片:METAL
摘要
- 阿里巴巴通义千问于9月20日在 Hugging Face 与魔搭社区公开了 Qwen-Image-2.1 权重。
- 生成、编辑与透明图像被装进同一个 7B 参数检查点,最多可接收 10 张参考图。
- ComfyUI、Diffusers、vLLM-Omni、SGLang 与 LightX2V 在首日开启支持,许可证为 Qwen Research License Agreement。
阿里巴巴通义千问团队于9月20日发布图像模型 Qwen-Image-2.1,并把权重上传至 Hugging Face 与魔搭社区。视觉生成部分为 7B 参数的单一模型既能按文字作图,也能修改已有图像,并可直接输出背景为空的透明图像。通义千问团队在公告中写道,该模型"在生成质量、推理效率与成本之间取得平衡"。
架构在公告与代码仓库中写得很清楚。Transformer 为 32 层单流 DiT,参数为 7B。文本编码器由 Qwen3-VL 8B 承担,把指令与条件图像归并为同一表示;VAE 是空间压缩 16 倍的 64 通道 RGBA 自编码器,因此透明度在模型内部处理。调度器采用流匹配加欧拉离散方式与动态偏移。
提速的关键在注意力层。文本使用词元级因果掩码,图像生成使用块级掩码,把粒度混合起来;输入图像与编辑指令只在第一步计算一次并存入缓存,其余步骤直接取用。通义千问团队表示,这种做法在放入多张图像进行编辑时尤其能提升推理效率并降低显存占用。
透明图像是这一版最大的新增。通义千问曾在2025年12月单独推出透明图像专用模型 Qwen-Image-Layered,这次把该能力并入同一个模型,并由提示词决定是否输出带 Alpha 通道的图像。给它一张照片,它能把指定对象抽成 RGBA 图层;在保持透明背景的前提下改变人物表情,或把图层中的文字换成别的词,也由同一个检查点完成。
编辑的抓手增加到四种。参考图最多可接收 10 张,可把六张单人肖像合成一张合影,把模特、衣服、鞋、包、帽子五张图合成一套完整穿搭,或用十张家具照片布置出一个房间。要修改的位置用不同颜色的圆圈或涂抹标注指定;若不希望遮挡原图,则把图像与蒙版分成两个输入。全景图、信息图与故事板也在任务清单之内。
分辨率默认为 2K。默认输出为 2048×2048,推理步数默认 40,并把从正方形到 2752×1536 的七种画幅固定为推荐尺寸。把短提示词扩写的专用模型也一同发布,是基于 Qwen3.5-VL 9B 分别针对文生图与图像编辑微调的两个版本。
首日支持名单显示了这个模型将在哪里运行。Diffusers 通过 QwenImage21Pipeline 接入,SGLang 加上了前缀缓存与多卡并行,vLLM-Omni 则加入 FP8 量化与分步执行。英伟达之外的路也是通的。AMD Radeon 通过 ROCm 运行,异构芯片软件栈 FlagOS 同时发布了面向八个芯片平台的预构建镜像与权重。
ComfyUI 在同日发布的介绍文章中把 Alpha 通道摆在最前面。文章称精灵图、标志、图标与产品去背图从采样器出来的那一刻就已可直接合成,"不需要抠背景节点,不需要抠像模型,也不需要修边"。随后又用一句话钉住差异:"其他主要开放模型都做不到这一点。"文本编码器节点每填满一个图像输入框就会再打开一个,最多十张。
METAL 查证的模型卡与代码仓库都写明许可证为 Qwen Research License Agreement。公告使用了开源一词,但附在权重上的协议并非宽松型许可,而是研究用许可。发布首日,Hugging Face 上已经出现基于该模型的 7 个微调版本、9 个量化版本与 12 个演示空间。
通义千问的发布节奏并非头一回。METAL 曾报道通义千问公开实时同传模型,而在图像方向,这一版是在 2026 年 2 月 Qwen-Image 2.0 推出七个月后到来的。在中国大陆,wuli.art 在 Chatbox 与 Canvas 中免费开放了包括透明背景生成在内的功能。
7B 这个数字正是这次发布的要点。默认 2K 输出、40 步的模型能装进消费级显卡显存,透明背景与十张参考图编辑出自同一个检查点。挑选图像模型时过去看的是质量与速度,如今正在转向产物能否不经修整就进入下一道工序。





评论