編按:本文綜合整理自 Hugging Face 官方 Qwen3.8-27B-FP8 模型頁、阿里千問官方 X 推文、IT之家 8 月 14 日報導,並加入 Siami 編輯部觀點與分析。
事件概述
2026 年 8 月 14 日晚間,阿里巴巴千問團隊正式開源 Qwen3.8-27B 模型,所有開發者、科研機構和企業均可自由下載、部署和使用。這是 Qwen3.8 系列的首發版本,以 27B 稠密(Dense)參數量達成超越 Qwen3.7-Plus 的整體表現,被官方定位為「目前最強的開源稠密模型」。
模型原生支援 262K 上下文,透過 YaRN 技術可外推至 1M tokens。作為原生多模態稠密模型,它不僅能處理文字,也內建視覺編碼器,能理解圖片、影片與 STEM 圖表。權重採用 FP8 細粒度量化(block size 128),效能與原模型幾乎一致,可直接相容 Hugging Face Transformers、vLLM、SGLang、TokenSpeed 等主流推論框架。
模型架構亮點
Qwen3.8-27B 採用混合注意力架構,並非純 Transformer:
- 參數量:27B(270 億參數)
- 層數:64 層,採用 Gated DeltaNet + Gated Attention 混合布局
- 隱藏維度:5120
- 詞嵌入:248,320(padded)
- 線性注意力頭:48 for V、16 for QK(Head Dim 128)
- 標準注意力頭:24 for Q、4 for KV(Head Dim 256)
- FFN 中間維度:17,408
- 多 token 預測(MTP):訓練時使用多步預測
27B 是全球 AI 社群呼聲最高的模型尺寸——既能在單張高階消費級 GPU(如 RTX 5090、RTX 4090)跑得動,又具備足夠能力處理複雜任務。
這種「16 × (3 × Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)」的混合架構,是 Qwen3.5 系列的延伸,能在保持稠密結構效率的同時,提升長序列處理能力。
Benchmark 表現:全面超越 Qwen3.7-Plus
官方公布的基準測試數據顯示,Qwen3.8-27B 在多項指標上超越自家前代旗艦 Qwen3.7-Plus:
程式設計與軟體工程
- Terminal Bench 2.1(代理終端編碼):Qwen3.8-27B 73.0 vs Qwen3.7-Plus 64.0
- SWE-bench Pro(代理編碼):Qwen3.8-27B 61.7 vs Qwen3.7-Plus 57.6
- DeepSWE 1.1(代理編碼):Qwen3.8-27B 42.2 vs Qwen3.7-Plus 14.2
- QwenSWEBench(軟體工程):Qwen3.8-27B 79.0 vs Qwen3.7-Plus 59.2
- LiveCodeBench v6(競賽編碼):Qwen3.8-27B 90.3 vs Qwen3.7-Plus 89.6
通用與專業任務
- IFBench(指令遵循):Qwen3.8-27B 79.5 vs Qwen3.7-Plus 79.1
- GPQA Diamond(科學推理):Qwen3.8-27B 89.2 vs Qwen3.7-Plus 90.3
- HLE(跨領域推理):Qwen3.8-27B 30.8 vs Qwen3.7-Plus 34.7
- JobBench(專業任務):Qwen3.8-27B 33.4 vs Qwen3.7-Plus 27.6
- CoWorkBench(長時任務):Qwen3.8-27B 70.7 vs Qwen3.7-Plus 65.1
多模態表現(VL Performance)
- OSWorld-Verified(電腦操作):Qwen3.8-27B 84.3 vs Qwen3.7-Plus 73.3
- WebArena-Verified(瀏覽器操作):Qwen3.8-27B 64.8 vs Qwen3.7-Plus 55.3
- AndroidWorld(行動操作):Qwen3.8-27B 81.9 vs Qwen3.7-Plus 81.0
- MathVision(含 CI,視覺數學):Qwen3.8-27B 94.6 vs Qwen3.7-Plus 85.1
- Vision2Web(視覺網頁開發):Qwen3.8-27B 62.9 vs Qwen3.7-Plus 42.1
- OmniDocBench 1.5(文件理解):Qwen3.8-27B 91.1 vs Qwen3.7-Plus 91.4
可以看到 Qwen3.8-27B 在「端到端任務完成」(SWE-bench Pro、DeepSWE、OSWorld、WebArena、Vision2Web)這類代理型任務上大幅領先,但在純知識問答(GPQA、HLE)上仍略遜於 Opus4.6 Max——這與官方定位「為長時任務而生」完全一致。
五大核心能力升級
官方列出 Qwen3.8-27B 的五大改進方向:
- 核心能力全面提升:在程式設計、專業工作、研究、長時代理任務都有實質進步
- 代理執行更可靠:自主規劃更強、對環境反饋處理更穩、端到端任務完成度更高
- 下游相容性更廣:更容易整合進既有開發棧,支援 Claude Code、vLLM、SGLang 等主流工具鏈
- 彈性思考控制:思考模式預設開啟,可按請求關閉;可透過
reasoning_effort調整推理深度;多輪對話保留推理上下文(preserve_thinking) - 原生視覺語言:支援圖片與影片理解,從 STEM 圖表到小時級影片皆可處理
開發者社群實測回饋
Qwen3.8-27B 一發布就在 Hacker News 引發熱烈討論,截至發稿已累積 1201 分、125 則留言。摘錄幾則代表性評價:
「Qwen 3.8 27B 是繼 Gemma 4 之後,第二個能通過我私有基準測試的本地模型。它花 5 倍 token 數與 12 分 30 秒通過,但 Laguna 與 Muse Glimmer 都失敗了。」 — 開發者 CMay
「已經達到 GLM-5.2 等級,但能在本地跑。我在 3090 上跑了 8 小時,房間變烤箱,但效果真的很好。」 — 開發者 XCSme
「用 RTX 5090 + Ninfer 推論引擎可以達到 ~138 tokens/秒,比 llama.cpp 預設配置快一倍。」 — 開發者 kimsey0
不過也有開發者指出思考模式預設行為改變:
「跟 3.6 比起來,3.8 在思考時會省略 to、we、for 等字,寫成『Need be helpful concise』、『Need ask!』這種穴居人風格。可能是 RL 過度激勵 token 效率造成的。」 — 開發者 dofm
另一位開發者 dofm 也提到,在 xhigh reasoning 預設模式下,模型會過度思考寫出過於複雜的程式碼,必須切換到 medium 模式才能避免。
為什麼這件事重要
Qwen3.8-27B 是開源社群第一次在 27B 這個甜蜜點(sweet spot)上,拿到接近或超越旗艦閉源模型的能力:
-
本地 AI 的臨界點:過去要在筆電或單卡消費級 GPU 上跑出「能用」的程式設計代理模型,只能選擇 Gemma 4 或 Qwen3.6 系列。Qwen3.8-27B 是首個在 SWE-bench Pro、OSWorld、Vision2Web 等代理基準上逼近 Opus4.6 Max 的開源稠密模型。
-
「開放權重小型稠密」打敗「封閉權重大型稀疏」的勝利:官方定位很清楚——比起 100B+ 的稀疏 MoE,27B 稠密模型能觸及更多開發者、學生、新創公司。一張 RTX 5090 就能跑得起、跑得好,這對 AI 平權意義重大。
-
多模態稠密的標竿:Qwen3.8-27B 是目前唯一原生支援圖片 + 影片理解的稠密開源 27B 模型。OSWorld 84.3、Vision2Web 62.9 這類「代理型視覺任務」分數,意味著它能直接看懂螢幕截圖、UI 介面並操作。
-
代理 AI 競賽的轉折:從 SWE-bench、DeepSWE、OSWorld、WebArena 的爆發性提升來看,阿里千問顯然押注「代理 AI 一定是下一個主戰場」。在 Anthropic、OpenAI、Google 還在閉源迭代 Claude Code / Operator 時,Qwen 已經把開源版本攤在陽光下。
-
API 服務即將上線:官方公告 Qwen Cloud 將提供預設 1M 上下文的 hosted 版本,並內建官方工具鏈。對不想自己部署的企業用戶,這意味著很快就能用 API 形式取用 Qwen3.8-27B 的全部能力。
數據解讀與質疑
雖然 Qwen3.8-27B 整體表現驚艷,但有幾點值得質疑與解讀:
1. 基準測試的可信度
官方在 SWE-bench Pro、NL2Repo-Bench、DeepSWE 1.1 等基準上明確標註「使用 Claude Code harness」——也就是說,所有模型(含其他競爭對手)都是用 Claude Code 的腳手架跑的。這對 Qwen3.8 來說是優勢(因為它的訓練資料可能包含 Claude Code 的使用模式),但對 Opus4.6 Max 來說反而是劣勢(它的「官方分數」可能用了不同 harness)。
質疑點:這是「公平比較」還是「精心挑選的評測條件」?獨立評測機構(lmsys、HELM)需要盡快複測。
2. 「過度思考」問題
多位開發者反映,預設的 xhigh reasoning 模式會讓模型寫出「過度複雜、充滿不必要的 edge case」的程式碼。一位開發者測試「WordPress 最後登入外掛」這類簡單任務時,發現模型會跑進兔子洞。
解讀:推理深度可調是好事,但預設值過高對一般開發者不友善。新手可能會覺得模型「太囉嗦」,要明確切換到 medium 或關閉思考模式才能拿到最佳結果。
3. Token 效率的成本
CMay 的測試顯示,Qwen 3.8 27B 完成 Gemma 4 能完成的私有基準,多花了 5 倍 token。雖然這對本地運行影響不大(不計費),但若上 Qwen Cloud API 計價,5 倍 token 意味著 5 倍成本。
4. 思考風格的「穴居人化」
多位用戶觀察到 Qwen3.8 的思考段落語法異常(省略 to、we、for),懷疑是 RL 過度激勵 token 效率所致。這是否會污染最終回答的語感?從目前實測看,正式回答(而非思考段落)仍正常,但值得持續關注。
5. 對手動部署者來說,硬體門檻仍然不低
雖然 27B 模型在 RTX 5090 上能跑,但 8 小時基準測試房間變烤箱、12 分鐘跑一個任務——這對日常使用仍是高摩擦。期待下一波量化(INT4、AWQ、GGUF q4_k_m)能把 VRAM 需求壓到 24GB 以下。
體驗地址
- Hugging Face:https://huggingface.co/Qwen/Qwen3.8-27B-FP8
- 魔搭社群(ModelScope):https://modelscope.cn/Qwen/Qwen3.8-27B-FP8
- Unsloth GGUF 量化版:https://huggingface.co/unsloth/Qwen3.8-27B-GGUF
- 官方 API(Qwen Cloud):即將上線,提供 1M 預設上下文
編按:本文綜合整理自 Hugging Face 官方 Qwen3.8-27B-FP8 模型頁、阿里千問官方 X 推文、IT之家 8 月 14 日報導,並加入 Siami 編輯部觀點與分析。
網友熱門留言 (6)