← 返回 Siami 首頁

阿里開源 Qwen3.8-27B:原生多模態 27B 稠密模型,262K 上下文可外推至 1M

▲ 1,201 💬 125
阿里開源 Qwen3.8-27B:原生多模態 27B 稠密模型,262K 上下文可外推至 1M

編按:本文綜合整理自 Hugging Face 官方 Qwen3.8-27B-FP8 模型頁、阿里千問官方 X 推文、IT之家 8 月 14 日報導,並加入 Siami 編輯部觀點與分析。

事件概述

2026 年 8 月 14 日晚間,阿里巴巴千問團隊正式開源 Qwen3.8-27B 模型,所有開發者、科研機構和企業均可自由下載、部署和使用。這是 Qwen3.8 系列的首發版本,以 27B 稠密(Dense)參數量達成超越 Qwen3.7-Plus 的整體表現,被官方定位為「目前最強的開源稠密模型」。

模型原生支援 262K 上下文,透過 YaRN 技術可外推至 1M tokens。作為原生多模態稠密模型,它不僅能處理文字,也內建視覺編碼器,能理解圖片、影片與 STEM 圖表。權重採用 FP8 細粒度量化(block size 128),效能與原模型幾乎一致,可直接相容 Hugging Face Transformers、vLLM、SGLang、TokenSpeed 等主流推論框架。


模型架構亮點

Qwen3.8-27B 採用混合注意力架構,並非純 Transformer:

  • 參數量:27B(270 億參數)
  • 層數:64 層,採用 Gated DeltaNet + Gated Attention 混合布局
  • 隱藏維度:5120
  • 詞嵌入:248,320(padded)
  • 線性注意力頭:48 for V、16 for QK(Head Dim 128)
  • 標準注意力頭:24 for Q、4 for KV(Head Dim 256)
  • FFN 中間維度:17,408
  • 多 token 預測(MTP):訓練時使用多步預測

27B 是全球 AI 社群呼聲最高的模型尺寸——既能在單張高階消費級 GPU(如 RTX 5090、RTX 4090)跑得動,又具備足夠能力處理複雜任務。

這種「16 × (3 × Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)」的混合架構,是 Qwen3.5 系列的延伸,能在保持稠密結構效率的同時,提升長序列處理能力。


Benchmark 表現:全面超越 Qwen3.7-Plus

官方公布的基準測試數據顯示,Qwen3.8-27B 在多項指標上超越自家前代旗艦 Qwen3.7-Plus:

程式設計與軟體工程

  • Terminal Bench 2.1(代理終端編碼):Qwen3.8-27B 73.0 vs Qwen3.7-Plus 64.0
  • SWE-bench Pro(代理編碼):Qwen3.8-27B 61.7 vs Qwen3.7-Plus 57.6
  • DeepSWE 1.1(代理編碼):Qwen3.8-27B 42.2 vs Qwen3.7-Plus 14.2
  • QwenSWEBench(軟體工程):Qwen3.8-27B 79.0 vs Qwen3.7-Plus 59.2
  • LiveCodeBench v6(競賽編碼):Qwen3.8-27B 90.3 vs Qwen3.7-Plus 89.6

通用與專業任務

  • IFBench(指令遵循):Qwen3.8-27B 79.5 vs Qwen3.7-Plus 79.1
  • GPQA Diamond(科學推理):Qwen3.8-27B 89.2 vs Qwen3.7-Plus 90.3
  • HLE(跨領域推理):Qwen3.8-27B 30.8 vs Qwen3.7-Plus 34.7
  • JobBench(專業任務):Qwen3.8-27B 33.4 vs Qwen3.7-Plus 27.6
  • CoWorkBench(長時任務):Qwen3.8-27B 70.7 vs Qwen3.7-Plus 65.1

多模態表現(VL Performance)

  • OSWorld-Verified(電腦操作):Qwen3.8-27B 84.3 vs Qwen3.7-Plus 73.3
  • WebArena-Verified(瀏覽器操作):Qwen3.8-27B 64.8 vs Qwen3.7-Plus 55.3
  • AndroidWorld(行動操作):Qwen3.8-27B 81.9 vs Qwen3.7-Plus 81.0
  • MathVision(含 CI,視覺數學):Qwen3.8-27B 94.6 vs Qwen3.7-Plus 85.1
  • Vision2Web(視覺網頁開發):Qwen3.8-27B 62.9 vs Qwen3.7-Plus 42.1
  • OmniDocBench 1.5(文件理解):Qwen3.8-27B 91.1 vs Qwen3.7-Plus 91.4

可以看到 Qwen3.8-27B 在「端到端任務完成」(SWE-bench Pro、DeepSWE、OSWorld、WebArena、Vision2Web)這類代理型任務上大幅領先,但在純知識問答(GPQA、HLE)上仍略遜於 Opus4.6 Max——這與官方定位「為長時任務而生」完全一致。


五大核心能力升級

官方列出 Qwen3.8-27B 的五大改進方向:

  1. 核心能力全面提升:在程式設計、專業工作、研究、長時代理任務都有實質進步
  2. 代理執行更可靠:自主規劃更強、對環境反饋處理更穩、端到端任務完成度更高
  3. 下游相容性更廣:更容易整合進既有開發棧,支援 Claude Code、vLLM、SGLang 等主流工具鏈
  4. 彈性思考控制:思考模式預設開啟,可按請求關閉;可透過 reasoning_effort 調整推理深度;多輪對話保留推理上下文(preserve_thinking)
  5. 原生視覺語言:支援圖片與影片理解,從 STEM 圖表到小時級影片皆可處理

開發者社群實測回饋

Qwen3.8-27B 一發布就在 Hacker News 引發熱烈討論,截至發稿已累積 1201 分、125 則留言。摘錄幾則代表性評價:

「Qwen 3.8 27B 是繼 Gemma 4 之後,第二個能通過我私有基準測試的本地模型。它花 5 倍 token 數與 12 分 30 秒通過,但 Laguna 與 Muse Glimmer 都失敗了。」 — 開發者 CMay

「已經達到 GLM-5.2 等級,但能在本地跑。我在 3090 上跑了 8 小時,房間變烤箱,但效果真的很好。」 — 開發者 XCSme

「用 RTX 5090 + Ninfer 推論引擎可以達到 ~138 tokens/秒,比 llama.cpp 預設配置快一倍。」 — 開發者 kimsey0

不過也有開發者指出思考模式預設行為改變:

「跟 3.6 比起來,3.8 在思考時會省略 to、we、for 等字,寫成『Need be helpful concise』、『Need ask!』這種穴居人風格。可能是 RL 過度激勵 token 效率造成的。」 — 開發者 dofm

另一位開發者 dofm 也提到,在 xhigh reasoning 預設模式下,模型會過度思考寫出過於複雜的程式碼,必須切換到 medium 模式才能避免。


為什麼這件事重要

Qwen3.8-27B 是開源社群第一次在 27B 這個甜蜜點(sweet spot)上,拿到接近或超越旗艦閉源模型的能力:

  1. 本地 AI 的臨界點:過去要在筆電或單卡消費級 GPU 上跑出「能用」的程式設計代理模型,只能選擇 Gemma 4 或 Qwen3.6 系列。Qwen3.8-27B 是首個在 SWE-bench Pro、OSWorld、Vision2Web 等代理基準上逼近 Opus4.6 Max 的開源稠密模型。

  2. 「開放權重小型稠密」打敗「封閉權重大型稀疏」的勝利:官方定位很清楚——比起 100B+ 的稀疏 MoE,27B 稠密模型能觸及更多開發者、學生、新創公司。一張 RTX 5090 就能跑得起、跑得好,這對 AI 平權意義重大。

  3. 多模態稠密的標竿:Qwen3.8-27B 是目前唯一原生支援圖片 + 影片理解的稠密開源 27B 模型。OSWorld 84.3、Vision2Web 62.9 這類「代理型視覺任務」分數,意味著它能直接看懂螢幕截圖、UI 介面並操作。

  4. 代理 AI 競賽的轉折:從 SWE-bench、DeepSWE、OSWorld、WebArena 的爆發性提升來看,阿里千問顯然押注「代理 AI 一定是下一個主戰場」。在 Anthropic、OpenAI、Google 還在閉源迭代 Claude Code / Operator 時,Qwen 已經把開源版本攤在陽光下。

  5. API 服務即將上線:官方公告 Qwen Cloud 將提供預設 1M 上下文的 hosted 版本,並內建官方工具鏈。對不想自己部署的企業用戶,這意味著很快就能用 API 形式取用 Qwen3.8-27B 的全部能力。


數據解讀與質疑

雖然 Qwen3.8-27B 整體表現驚艷,但有幾點值得質疑與解讀:

1. 基準測試的可信度

官方在 SWE-bench Pro、NL2Repo-Bench、DeepSWE 1.1 等基準上明確標註「使用 Claude Code harness」——也就是說,所有模型(含其他競爭對手)都是用 Claude Code 的腳手架跑的。這對 Qwen3.8 來說是優勢(因為它的訓練資料可能包含 Claude Code 的使用模式),但對 Opus4.6 Max 來說反而是劣勢(它的「官方分數」可能用了不同 harness)。

質疑點:這是「公平比較」還是「精心挑選的評測條件」?獨立評測機構(lmsys、HELM)需要盡快複測。

2. 「過度思考」問題

多位開發者反映,預設的 xhigh reasoning 模式會讓模型寫出「過度複雜、充滿不必要的 edge case」的程式碼。一位開發者測試「WordPress 最後登入外掛」這類簡單任務時,發現模型會跑進兔子洞。

解讀:推理深度可調是好事,但預設值過高對一般開發者不友善。新手可能會覺得模型「太囉嗦」,要明確切換到 medium 或關閉思考模式才能拿到最佳結果。

3. Token 效率的成本

CMay 的測試顯示,Qwen 3.8 27B 完成 Gemma 4 能完成的私有基準,多花了 5 倍 token。雖然這對本地運行影響不大(不計費),但若上 Qwen Cloud API 計價,5 倍 token 意味著 5 倍成本。

4. 思考風格的「穴居人化」

多位用戶觀察到 Qwen3.8 的思考段落語法異常(省略 to、we、for),懷疑是 RL 過度激勵 token 效率所致。這是否會污染最終回答的語感?從目前實測看,正式回答(而非思考段落)仍正常,但值得持續關注。

5. 對手動部署者來說,硬體門檻仍然不低

雖然 27B 模型在 RTX 5090 上能跑,但 8 小時基準測試房間變烤箱、12 分鐘跑一個任務——這對日常使用仍是高摩擦。期待下一波量化(INT4、AWQ、GGUF q4_k_m)能把 VRAM 需求壓到 24GB 以下。


體驗地址

編按:本文綜合整理自 Hugging Face 官方 Qwen3.8-27B-FP8 模型頁、阿里千問官方 X 推文、IT之家 8 月 14 日報導,並加入 Siami 編輯部觀點與分析。

網友熱門留言 (6)

#1 Hacker News 用戶 CMay ▲ 87
Qwen 3.8 27B 是繼 Gemma 4 之後,第二個能通過我私有基準測試的本地模型。它花了 5 倍 token 數和 12 分 30 秒(啟用 MTP)通過。Gemma 4 是隱性推理、Qwen 3.8 是顯性推理;Laguna 與 Muse Glimmer 都失敗得很慘。
#2 Hacker News 用戶 XCSme ▲ 64
這模型太驚人了,已經達到 GLM-5.2 等級,而且可以在本地跑!我在 3090 上測試了 8 小時,房間變成烤箱(外面 35 度以上),但效果真的很好。理論上,現在你可以直接和電腦說話,讓它本地執行所有事情。
#3 Hacker News 用戶 dexterlagan ▲ 52
用我常用的評測方式簡單測了一下:先問幾個小型模型常答錯的常識題,再讓它用 JS 寫完整功能的 todo list 應用,最後改寫成 Rust + Tauri 版本。只要能完成最後這步,後續就能建構實際的軟體工程能力。Qwen 3.8 27B 在這方面表現出乎意料地好。
#4 Hacker News 用戶 simonw ▲ 41
這是我見過筆電能跑的模型中,畫出最棒的一隻鵜鶘!腳踏車形狀正確、鵜鶘嘴超棒、背景也很好。最重要的是鵜鶘的兩條腿剛好分在腳踏車兩側——這非常罕見(雖然腳踏車沒裝鏈條)。
#5 Hacker News 用戶 dofm ▲ 38
跟 3.6 比起來,3.8 在思考時會省略 to、we、for 等字,寫成『Need be helpful concise』、『Need maybe not overdo』這種穴居人風格。我有個(無根據、模糊的)懷疑:這種獨特的思考方式可能是 RL 過度激勵 token 效率造成的。
#6 Hacker News 用戶 RandyOrion ▲ 35
感謝 Qwen 團隊的這次發布。比起閉權重或稀疏 MoE 的大模型,開放權重的小型稠密模型其實對公眾最有益,因為它能觸及更多人。Qwen 3.8 的思考風格變化很大,預設的 xhigh 預算下會想得更多更久。