← 返回 Siami 首頁

阿里開源 Qwen3.8-2.4T-A95B 權重:2.4 兆參數 MoE、原生 256K 上下文、首個開放的 Qwen-Max 等級模型

▲ 76 💬 42
阿里開源 Qwen3.8-2.4T-A95B 權重:2.4 兆參數 MoE、原生 256K 上下文、首個開放的 Qwen-Max 等級模型

編按:本文綜合整理自 Hugging Face 模型卡、IT 之家、vLLM 官方部落格、NVIDIA Developer Blog、The New Stack 與 Latent.Space,並加入 Siami 編輯部觀點與分析。

事件總覽

阿里 Qwen 團隊於 2026 年 8 月 12 日深夜,透過「魔搭 ModelScope 社區」官方公眾號宣布,正式於 Hugging Face 與 ModelScope 同步開放 Qwen3.8-2.4T-A95B 模型權重。這是 Qwen 史上第一次把 Max 等級(最高階)的模型權重開放出來,也讓它一躍成為當前「參數總量最大的開源語言模型」之一。

從 8 月 3 日 Qwen3.8-Max 以付費 API 形式上線,到 8 月 12 日底層權重正式落地,整整隔了 9 天——比官方最初承諾的「一週內」多拖了 2 天,但仍在社區普遍預期內。

規格項目數值
總參數2.4 兆(2.4T)
每 Token 啟動參數95B
專家數每 MoE 層 512 個(每 Token 選 10 個路由專家 + 1 個共享專家)
層數92 層混合注意力骨幹
線性注意力層69 層(每 4 層一個 full attention)
原生上下文262,144 Token(256K)
可擴展上下文約 1,010,000 Token(1M)
訓練特徵多步 MTP(Multi-Token Prediction)
BF16 權重體積約 4.45 TiB
FP8 權重體積約 2.27 TiB
MXFP4 / NVFP4 W4A41.45 / 1.32 TiB(單節點可跑)

模型設計重點

混合注意力架構

Qwen3.8-2.4T-A95B 採用 92 層 hybrid-attention 骨幹:其中只有 23 層跑標準的 full attention(full_attention_interval: 4),其餘 69 層是帶恆定 recurrent state 的線性注意力。這是一個純文字因果語言模型——config.json 內沒有 vision_config,權重索引也找不到任何視覺張量。

官方 API 版 Qwen3.8-Max 才補上 vision 輸入、1M 上下文預設、non-thinking 模式與內建工具。開源版本是「純文字 + thinking 強制開啟」的基座。

512 專家的稀疏 MoE

每個 MoE 層包含 512 個專家,每 Token 動態選 10 個路由專家 + 1 個共享專家——這樣的設計把單 Token 計算量壓在大約 95B dense 等效的水準,但同時擁有 2.4T 的記憶體容量。

  • Inference cost:接近 95B dense 模型
  • Knowledge capacity:貼近 2.4T dense 模型
  • MXFP4(AMD)/ NVFP4 W4A4(NVIDIA Blackwell)量化:可塞進單一節點

多步 MTP 訓練

模型額外做了多步 Multi-Token Prediction 訓練,讓支援 MTP 機制的推理引擎(vLLM、TensorRT-LLM)可以提前預測多個後續 Token,提升 speculative decoding 的命中率。


基準與定位

官方公布的評測涵蓋程式 Agent、通用 Agent、專業工作與長上下文等四大方向,與 Opus 4.8、Fable 5、GPT-5.6 Sol 對比。在 PaperBench、IFBench 等基準上取得所列模型中的較高成績。

幾個值得注意的分數(節錄自官方模型卡):

BenchmarkQwen3.8-2.4T-A95B同期比較
PaperBench93同類最高
GPQA Diamond92.6接近 Fable 5
Terminal Bench 2.186.6高於 Opus 4.8 / Fable 5
AndroidBench69.8略低於 Fable 5
QwenReactBench1694同類最高
MRCR v2 256K(8-needle)83.2略低於 Fable 5
LongBench v269.1同類最高

同一時間段內,DeepSeek V4 Pro 正式版也剛上線、Grok 4.6 也發布。三家 frontier 模型同週亮相,把「中國開源 vs. 美國閉源」的競爭直接推到 2.4T 級別。


部署與生態

vLLM Day-0 支援

vLLM 官方 8 月 12 日當天釋出 nightly 版本,已可載入 Qwen3.8-2.4T-A95B。官方推薦推理參數:

temperature=1.0, top_p=0.95, top_k=20,
min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0

硬體需求(以官方模型卡為準):

精度權重大小8 × B300(2144 GB)8 × MI355X(2304 GB)8 × H200(1128 GB)
BF164.45 TiB3 節點3 節點6 節點
FP82.27 TiB2 節點2 節點4 節點
MXFP4(AMD)1.45 TiB—1 節點2 節點
NVFP4 W4A4(NVIDIA)1.32 TiB1 節點—2 節點

NVIDIA GB300 NVL72 表現

在 NVIDIA GB300 NVL72 上以 FP8 跑,可達 4K+ tokens/秒/GPU 吞吐量與 350+ tokens/秒/用戶的延遲表現。SGLang 與 NVIDIA Dynamo 也都同步釋出對應的開源部署食譜。

開源社群工具

  • Unsloth 1-bit build:把模型進一步量化到 397 GB(已可在單節點載入)
  • vLLM Recipes:完整的部署指南已上架 recipes.vllm.ai
  • transformers >= 5.4.0 為官方紀錄的最低相依版本

為什麼這件事重要

1. 把「Qwen-Max 等級」從閉源 API 變成可審計的權重

過去 Qwen 系列最高階模型(Qwen3.5-Max、Qwen3.7-Max 等)都只以付費 API 形式提供——研究者要重現 benchmark 必須自己串 API,無法看到完整權重。Qwen3.8-2.4T-A95B 是第一個 Max 等級模型以開源權重形式落地,獨立研究者可以下載、做完整的行為審計、提供者可以在權重之上競爭服務價格,團隊可以重現測試而不是追逐一直在變動的 preview endpoint。

從商業模式來看,這也是阿里第一次用「開源旗艦」打頭陣——過去 OpenAI、Anthropic 的 frontier 模型幾乎從未以原始權重形式放出來過。

2. 開源 vs 閉源的 frontier 差距正在急速收斂

同一週 DeepSeek V4 Pro(1.6T MoE,價格僅 Claude Opus 4.7 的 1/15)、Grok 4.6(AA Index 61 分)、Qwen3.8-2.4T-A95B 三家同時間亮相。從結果來看:

  • 程式碼、Agent、長上下文等任務上,開源模型已能在多項 benchmark 與閉源 frontier 並駕齊驅
  • 「付費 API 才能跑出 frontier 表現」這個命題正在被改寫
  • 真正能自我運行的 frontier 等級模型,部署成本正在快速下降

3. 對開發者的實際影響

對想自部署的開發者,最重要的選擇權衡已經變成:

  • 極強的評測表現 ✓
  • 激進的 token 定價(Qwen3.8-Max 官方 input $2 / output $6 per 1M)
  • 巨大的服務佔地 ✗(單節點就算用 NVFP4 也要 1.32 TiB)
  • 可能的授權/管轄區限制 ✗(license metadata 標為「other」,商用前要逐條核對)

對想用 API 的人來說,Qwen3.8-Max 把 frontier 等級的 input token 價格壓到 $2 / 1M——相較 Opus 4.8、Fable 5 這些閉源對手,是實質的價格破壞。


數據解讀與質疑

1. 開源不等於人人能跑

雖然權重放在 Hugging Face 上公開,但 2.4T 模型在 BF16 下要 4.45 TiB 顯存,連 8 × H200 都得 6 節點才能完整跑起來。對大多數個人開發者或小型團隊,實際上仍只能:

  • 用 Qwen3.8-Max API(付費)
  • 等社群推出 Unsloth 397GB 1-bit build 之類的極端量化版本
  • 期待阿里後續釋出 distilled 中型變體(目前還沒有 122B 這種工作站可載的版本)

NVIDIA 開發者論壇上已有用戶反映:「我就想要一個 122B 的 Qwen3.8,這個 2T 版本沒人跑得起來。」這個 gap 是開源策略能否真正落地為社群生產力的關鍵。

2. License 仍待釐清

官方 license metadata 標為「other」,並非 Apache 2.0 或 MIT 等標準開源授權。這意味著:

  • 商用限制:部分商業場景可能受限
  • 出口/管轄限制:中國廠商模型在歐美部分場景仍需檢查
  • 再分發條款:第三方部署商是否可直接提供託管服務,需逐字核對 license

社群已有聲音認為這是「穿著開源外衣的 API 商業模式」——但即便如此,比起純閉源 API,仍是可審計、可下載的進步。

3. Benchmark 與真實工作負載的落差

不論是 Qwen 官方的 PaperBench 93 分,還是 AA Index 的整體分數,目前的 benchmark 都還無法完整捕捉「簡潔清楚的溝通」「跨多天的任務自我管理」「真實軟體工程除錯」這類實戰能力。

Hacker News 上有開發者明確表示:「我常常要把 Claude-Code + Opus-5 換成 Codex + GPT-5.6-sol,整個通訊品質才清爽。當前 benchmark 在這方面有缺。」這個 gap 短期內不會因為任何單一模型的發布而消失。

4. 92 層 hybrid 架構的權衡

23 層 full attention + 69 層線性注意力的設計,能大幅降低長上下文的計算量與記憶體,但同時也限制了「精確檢索」這類對長距離依賴敏感的任務表現。對需要在 256K~1M 上下文中找具體細節的工作(例如大型 codebase 內的精確查找),這個架構是否真能完全取代 full attention,是後續 benchmark 需要重點驗證的點。


參考來源

網友熱門留言 (3)

#1 Threads 開發者 sliven0722 0
這不是第一個喊 coding 很強的模型。但 Qwen3.8-Max 把『長時間自己規劃、自己修、自己迭代』這件事講得比較具體,而且定價也壓到 input $2 / output $6。開源節奏還是比多數 frontier 模型快,權重真正放出來之後,實際能跑多遠,才是下一關。
#2 Hacker News 評論(Qwen 3.8 Max 討論串) ▲ 58
Different benchmarks: Artificial Analysis Agentic Index 代表 GDPval-AA v2、Tau³-Banking 等加權平均。我常常要把 Claude-Code 跟 Opus-5 換成 Codex + GPT-5.6-sol,整個通訊品質才清爽。當前 benchmark 在簡潔清楚的溝通這塊應該還有缺。
#3 NVIDIA AI Infrastructure(官方 X 帳號) 0
Massive open-weight model drop! Congratulations to Qwen on releasing the open weights for Qwen3.8-2.4T-A95B, a 2.4T parameter model with 95B active, designed for demanding reasoning and agentic workloads. Out of the box, the model achieves 4K+ tokens/second per GPU on NVIDIA GB300 NVL72 in FP8 precision.