← 返回 Siami 首頁

阿里開源 Qwen-Image-2.1 輕量 7B 架構、原生 RGBA 透明圖、多達 10 張參考圖編輯一次到位

▲ 197 💬 116
阿里開源 Qwen-Image-2.1 輕量 7B 架構、原生 RGBA 透明圖、多達 10 張參考圖編輯一次到位

編按:本文綜合整理自 Qwen 官方部落格GitHub READMEHuggingFace 模型卡Comfy 官方部落格,並加入 Siami 編輯部觀點與分析。

阿里通義千問團隊於 2026 年 9 月 20 日正式開源 Qwen-Image-2.1——一款把「文生圖」與「圖像編輯」整合在同一個模型裡的開源作品。它的視覺生成元件只有 7B 參數、32 層 Single-Stream DiT,卻原生支援 2K 解析度、RGBA 透明通道,以及最多 10 張參考圖的合成編輯。從釋出當天起,Diffusers、ComfyUI、vLLM-Omni、SGLang、LightX2V 五大主流框架同步完成 Day-0 支援,是近期開源圖像模型生態裡極少見的「一次到位」案例。


四大核心升級

Qwen 官方把這次改版濃縮成四個關鍵字,每一項都直接對應到使用者的真實痛點。

  • Compact and Efficient:採用混合粒度注意力(mixed-granularity attention)與 prefix KV cache 復用,在低運算成本下維持影像品質。這意味著 7B 規模就有機會跑在消費級 GPU 上。
  • Native Transparency, Unified Creation and Editing:模型可直接生成 RGBA 透明圖、編輯透明圖層、從照片中分離主體——三件原本要切換不同工具的事情,現在一個模型完成。
  • Versatile Editing:支援最多 10 張參考圖 進行多主體合成;可透過圓圈、塗鴉註記或獨立遮罩指定局部修改;人物與商品的身份特徵在編輯過程中會被保留。
  • Realistic Textures and Refined Aesthetics:強化字型排版、人像光影與細節紋理,視覺結果更接近專業商業素材。

「7B 參數做到 native 2K、RGBA、多圖編輯,這是把『小而強』推到新邊界。」—— Siami 編輯部


開源生態同步到位

這次發布最值得注意的,是基礎設施層幾乎沒有摩擦。9 月 20 日當天,五個關鍵框架同步推出支援,使用者不必等待社群移植。

框架 / 工具整合方式對應資源
DiffusersQwenImage21Pipeline(PR #14804)直接 from_pretrained("Qwen/Qwen-Image-2.1")
ComfyUI原生節點,Day-0 支援權重 Comfy-Org/Qwen-Image-2.1
vLLM-Omni高效能推理,含 FP8、CUDA Graphprefix KV cache + TP/Ulysses 平行化
SGLang完整平行策略(PR #39983)prefix caching、Cache-DiT、component offload
LightX2V推論加速腳本開箱即用指南

對開發者來說,這代表不論是走 Python API、視覺化節點、還是高效能服務部署,當天就能選到一條成熟的路徑。


模型架構與訓練亮點

Qwen-Image-2.1 在架構上做了幾個取捨,目標是讓「7B 規模」也能負擔 2K 工作負載:

  • Single-Stream DiT:32 層統一處理文字與影像條件,簡化跨模態融合的運算路徑。
  • Prefix KV Cache 復用:當 checkpoint 設定 causal_condition: true 時,文字與條件圖的前綴在整個去噪過程中只編碼一次。多張參考圖的編輯任務能直接受惠。
  • causal condition 設計:Transformer 會自動快取條件上下文,避免每一步都重算。
  • 記憶體優化:內建 enable_model_cpu_offload(),讓 8GB 等級顯卡也能勉強跑推論。
from diffusers import QwenImage21Pipeline
import torch

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16
).to("cuda")

image = pipe(
    prompt="A neon shop sign that reads \"QWEN IMAGE 2.1\", rainy night, reflections on wet pavement",
    num_inference_steps=40,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]
image.save("t2i_example.png")

多元工作流:文字、編輯、透明一次搞定

文字生成影像(Text-to-Image)

預設解析度 2048 × 2048,原生 2K。建議比例涵蓋 1:1、4:3、3:4、3:2、2:3、16:9、9:16,最高可達 2752 × 1536。

單張影像編輯

from PIL import Image
input_image = Image.open("input.png")
image = pipe(
    prompt="Change the background to a sunset beach",
    image=input_image,
    num_inference_steps=40,
).images[0]
image.save("edit_example.png")

多張參考圖合成

模型最多接受 10 張參考圖,可用同一段 prompt 描述三個人物圍著營火、合成家庭合照,或維持多個商品的形象一致性。

原生 RGBA 透明圖

官方建議的 prompt 模板:

This is an RGBA image with transparency. <your description>. The image has alpha channel and the background is transparent.

模型會在輸出時自動保留 alpha 通道,省去後處理去背的麻煩。


為什麼這件事重要

開源圖像模型這幾年一直繞著「更大、更強、更貴」打轉——從 SDXL 到 FLUX.1 到 GPT Image,每一代的旗艦模型動輒 20B 以上參數、且商業授權日益收緊。Qwen-Image-2.1 走了一條相反的路:用 7B 參數 + 開源權重 + Qwen Research License 切入市場,等於把「能跑、好改、不怕商用踩雷」三件事綁在一起賣。

這個策略帶來三個外溢效應:

  1. 本地端部署門檻下降:7B 模型在消費級顯卡(如 RTX 4090、5090)已可流暢推論,加上 prefix KV cache,編輯任務的延遲明顯降低。
  2. 工具鏈全面 Day-0:Diffusers、ComfyUI、vLLM-Omni、SGLang 同時上車,使用者不必「等社群移植」。
  3. RGBA 原生支援打中設計師痛點:透明圖生成與編輯過去是付費 API 的差異化功能,現在開源模型也能做。

對 Siami 來說,這是「小模型逆襲大型閉源模型」敘事的又一次驗證——參數量不是唯一指標,工程細節(KV cache、混合粒度注意力、causal condition)才是把 7B 推到生產線的關鍵。


數據解讀與質疑

值得冷靜看待的幾個數字與訊號:

  • 沒有公開 benchmark 數字。kie.ai 的獨立測試指出,截至發稿為止,官方沒有釋出 GenEval、DPG、OneIG-Bench 等標準基準的分數,無法直接與 FLUX.2 或 GPT Image 1.0 做橫向比較。
  • Reddit 早期實測出現保留意見。r/StableDiffusion 有開發者反映:「initial tests,Qwen Image 2.1 quality is below that of GPT Image 1.0。」這與官方「refined aesthetics」的說法存在落差,可能要等更多第三方評測才能定論。
  • 授權仍有限制。採用 Qwen Research License 而非 Apache 2.0,商用前需要逐條檢視條款。
  • 生態雖 Day-0,但分散式部署尚未統一。vLLM-Omni、SGLang、LightX2V 各有自己的優化路徑,企業要選哪一條仍需實測。
  • 競爭對手動態。FLUX 3 雖然沒有開放圖像 tier 的 endpoint,GPT Image 2.5 已強化了商業可用性。開源並不等於全面領先。

換句話說,Qwen-Image-2.1 的「策略性意義」大於「當前品質意義」——它是開源社群追趕閉源前沿的重要里程碑,但短期內仍需要更多獨立 benchmark 與真實案例來驗證。


快速上手資源

想立刻體驗的使用者,可以從 HuggingFace Spaces 上的 Demo 開始;如果要走本地部署,ComfyUI 是視覺化最快上手的路徑;若要做服務化,vLLM-Omni 或 SGLang 的 Day-0 整合提供了高吞吐選項。


結語

Qwen-Image-2.1 不是那種「讓人驚呼」的革命性模型,但它是開源圖像模型「實用化」的一個清晰節點。當參數量回到 7B、授權明確、工具鏈同步到位,企業與個人開發者第一次能用「合理的成本 + 完全的控制權」跑出生產等級的文生圖與影像編輯。這也意味著,AI 圖像生成的戰場,正從「誰更大」轉向「誰更好整合」。

網友熱門留言 (4)

#1 r/LocalLLaMA 網友 ▲ 524
Compact & exceptionally fast,輕量 7B 架構搭配 native 2K 跟真正可用的文字渲染,524 推。
#2 r/StableDiffusion 網友 ▲ 522
Qwen-Image-2.1 現在原生支援透明圖生成,也能直接編輯透明圖層,這塊超實用。
#3 StableDiffusion 開發者 ▲ 188
After initial tests,Qwen Image 2.1 quality 略低於 GPT Image 1.0,但 7B 開源這點非常加分。
#4 ComfyUI 使用者 ▲ 156
ComfyUI Day-0 原生支援,相容權重直接從 Comfy-Org/Qwen-Image-2.1 下載就能跑。