編按:本文綜合整理自 Qwen 官方部落格、GitHub README、HuggingFace 模型卡、Comfy 官方部落格,並加入 Siami 編輯部觀點與分析。
阿里通義千問團隊於 2026 年 9 月 20 日正式開源 Qwen-Image-2.1——一款把「文生圖」與「圖像編輯」整合在同一個模型裡的開源作品。它的視覺生成元件只有 7B 參數、32 層 Single-Stream DiT,卻原生支援 2K 解析度、RGBA 透明通道,以及最多 10 張參考圖的合成編輯。從釋出當天起,Diffusers、ComfyUI、vLLM-Omni、SGLang、LightX2V 五大主流框架同步完成 Day-0 支援,是近期開源圖像模型生態裡極少見的「一次到位」案例。
四大核心升級
Qwen 官方把這次改版濃縮成四個關鍵字,每一項都直接對應到使用者的真實痛點。
- Compact and Efficient:採用混合粒度注意力(mixed-granularity attention)與 prefix KV cache 復用,在低運算成本下維持影像品質。這意味著 7B 規模就有機會跑在消費級 GPU 上。
- Native Transparency, Unified Creation and Editing:模型可直接生成 RGBA 透明圖、編輯透明圖層、從照片中分離主體——三件原本要切換不同工具的事情,現在一個模型完成。
- Versatile Editing:支援最多 10 張參考圖 進行多主體合成;可透過圓圈、塗鴉註記或獨立遮罩指定局部修改;人物與商品的身份特徵在編輯過程中會被保留。
- Realistic Textures and Refined Aesthetics:強化字型排版、人像光影與細節紋理,視覺結果更接近專業商業素材。
「7B 參數做到 native 2K、RGBA、多圖編輯,這是把『小而強』推到新邊界。」—— Siami 編輯部
開源生態同步到位
這次發布最值得注意的,是基礎設施層幾乎沒有摩擦。9 月 20 日當天,五個關鍵框架同步推出支援,使用者不必等待社群移植。
| 框架 / 工具 | 整合方式 | 對應資源 |
|---|---|---|
| Diffusers | QwenImage21Pipeline(PR #14804) | 直接 from_pretrained("Qwen/Qwen-Image-2.1") |
| ComfyUI | 原生節點,Day-0 支援 | 權重 Comfy-Org/Qwen-Image-2.1 |
| vLLM-Omni | 高效能推理,含 FP8、CUDA Graph | prefix KV cache + TP/Ulysses 平行化 |
| SGLang | 完整平行策略(PR #39983) | prefix caching、Cache-DiT、component offload |
| LightX2V | 推論加速腳本 | 開箱即用指南 |
對開發者來說,這代表不論是走 Python API、視覺化節點、還是高效能服務部署,當天就能選到一條成熟的路徑。
模型架構與訓練亮點
Qwen-Image-2.1 在架構上做了幾個取捨,目標是讓「7B 規模」也能負擔 2K 工作負載:
- Single-Stream DiT:32 層統一處理文字與影像條件,簡化跨模態融合的運算路徑。
- Prefix KV Cache 復用:當 checkpoint 設定
causal_condition: true時,文字與條件圖的前綴在整個去噪過程中只編碼一次。多張參考圖的編輯任務能直接受惠。 - causal condition 設計:Transformer 會自動快取條件上下文,避免每一步都重算。
- 記憶體優化:內建
enable_model_cpu_offload(),讓 8GB 等級顯卡也能勉強跑推論。
from diffusers import QwenImage21Pipeline
import torch
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A neon shop sign that reads \"QWEN IMAGE 2.1\", rainy night, reflections on wet pavement",
num_inference_steps=40,
generator=torch.Generator("cuda").manual_seed(42),
).images[0]
image.save("t2i_example.png")
多元工作流:文字、編輯、透明一次搞定
文字生成影像(Text-to-Image)
預設解析度 2048 × 2048,原生 2K。建議比例涵蓋 1:1、4:3、3:4、3:2、2:3、16:9、9:16,最高可達 2752 × 1536。
單張影像編輯
from PIL import Image
input_image = Image.open("input.png")
image = pipe(
prompt="Change the background to a sunset beach",
image=input_image,
num_inference_steps=40,
).images[0]
image.save("edit_example.png")
多張參考圖合成
模型最多接受 10 張參考圖,可用同一段 prompt 描述三個人物圍著營火、合成家庭合照,或維持多個商品的形象一致性。
原生 RGBA 透明圖
官方建議的 prompt 模板:
This is an RGBA image with transparency. <your description>. The image has alpha channel and the background is transparent.
模型會在輸出時自動保留 alpha 通道,省去後處理去背的麻煩。
為什麼這件事重要
開源圖像模型這幾年一直繞著「更大、更強、更貴」打轉——從 SDXL 到 FLUX.1 到 GPT Image,每一代的旗艦模型動輒 20B 以上參數、且商業授權日益收緊。Qwen-Image-2.1 走了一條相反的路:用 7B 參數 + 開源權重 + Qwen Research License 切入市場,等於把「能跑、好改、不怕商用踩雷」三件事綁在一起賣。
這個策略帶來三個外溢效應:
- 本地端部署門檻下降:7B 模型在消費級顯卡(如 RTX 4090、5090)已可流暢推論,加上 prefix KV cache,編輯任務的延遲明顯降低。
- 工具鏈全面 Day-0:Diffusers、ComfyUI、vLLM-Omni、SGLang 同時上車,使用者不必「等社群移植」。
- RGBA 原生支援打中設計師痛點:透明圖生成與編輯過去是付費 API 的差異化功能,現在開源模型也能做。
對 Siami 來說,這是「小模型逆襲大型閉源模型」敘事的又一次驗證——參數量不是唯一指標,工程細節(KV cache、混合粒度注意力、causal condition)才是把 7B 推到生產線的關鍵。
數據解讀與質疑
值得冷靜看待的幾個數字與訊號:
- 沒有公開 benchmark 數字。kie.ai 的獨立測試指出,截至發稿為止,官方沒有釋出 GenEval、DPG、OneIG-Bench 等標準基準的分數,無法直接與 FLUX.2 或 GPT Image 1.0 做橫向比較。
- Reddit 早期實測出現保留意見。r/StableDiffusion 有開發者反映:「initial tests,Qwen Image 2.1 quality is below that of GPT Image 1.0。」這與官方「refined aesthetics」的說法存在落差,可能要等更多第三方評測才能定論。
- 授權仍有限制。採用 Qwen Research License 而非 Apache 2.0,商用前需要逐條檢視條款。
- 生態雖 Day-0,但分散式部署尚未統一。vLLM-Omni、SGLang、LightX2V 各有自己的優化路徑,企業要選哪一條仍需實測。
- 競爭對手動態。FLUX 3 雖然沒有開放圖像 tier 的 endpoint,GPT Image 2.5 已強化了商業可用性。開源並不等於全面領先。
換句話說,Qwen-Image-2.1 的「策略性意義」大於「當前品質意義」——它是開源社群追趕閉源前沿的重要里程碑,但短期內仍需要更多獨立 benchmark 與真實案例來驗證。
快速上手資源
- 官方部落格:https://qwen.ai/blog?id=qwen-image-2.1
- GitHub 倉庫:https://github.com/QwenLM/Qwen-Image-2.1
- HuggingFace 模型卡:https://huggingface.co/Qwen/Qwen-Image-2.1
- ModelScope 模型庫:https://modelscope.cn/models/Qwen/Qwen-Image-2.1
- ComfyUI 整合部落格:https://blog.comfy.org/p/qwen-image-21-in-comfyui-open-weight
- Diffusers PR:https://github.com/huggingface/diffusers/pull/14804
- SGLang PR:https://github.com/sgl-project/sglang/pull/39983
- 官方 Demo:https://huggingface.co/spaces/Qwen/Qwen-Image-2.1
想立刻體驗的使用者,可以從 HuggingFace Spaces 上的 Demo 開始;如果要走本地部署,ComfyUI 是視覺化最快上手的路徑;若要做服務化,vLLM-Omni 或 SGLang 的 Day-0 整合提供了高吞吐選項。
結語
Qwen-Image-2.1 不是那種「讓人驚呼」的革命性模型,但它是開源圖像模型「實用化」的一個清晰節點。當參數量回到 7B、授權明確、工具鏈同步到位,企業與個人開發者第一次能用「合理的成本 + 完全的控制權」跑出生產等級的文生圖與影像編輯。這也意味著,AI 圖像生成的戰場,正從「誰更大」轉向「誰更好整合」。
網友熱門留言 (4)