編按:本文綜合整理自 Hugging Face 模型卡、IT 之家、vLLM 官方部落格、NVIDIA Developer Blog、The New Stack 與 Latent.Space,並加入 Siami 編輯部觀點與分析。
事件總覽
阿里 Qwen 團隊於 2026 年 8 月 12 日深夜,透過「魔搭 ModelScope 社區」官方公眾號宣布,正式於 Hugging Face 與 ModelScope 同步開放 Qwen3.8-2.4T-A95B 模型權重。這是 Qwen 史上第一次把 Max 等級(最高階)的模型權重開放出來,也讓它一躍成為當前「參數總量最大的開源語言模型」之一。
從 8 月 3 日 Qwen3.8-Max 以付費 API 形式上線,到 8 月 12 日底層權重正式落地,整整隔了 9 天——比官方最初承諾的「一週內」多拖了 2 天,但仍在社區普遍預期內。
| 規格項目 | 數值 |
|---|---|
| 總參數 | 2.4 兆(2.4T) |
| 每 Token 啟動參數 | 95B |
| 專家數 | 每 MoE 層 512 個(每 Token 選 10 個路由專家 + 1 個共享專家) |
| 層數 | 92 層混合注意力骨幹 |
| 線性注意力層 | 69 層(每 4 層一個 full attention) |
| 原生上下文 | 262,144 Token(256K) |
| 可擴展上下文 | 約 1,010,000 Token(1M) |
| 訓練特徵 | 多步 MTP(Multi-Token Prediction) |
| BF16 權重體積 | 約 4.45 TiB |
| FP8 權重體積 | 約 2.27 TiB |
| MXFP4 / NVFP4 W4A4 | 1.45 / 1.32 TiB(單節點可跑) |
模型設計重點
混合注意力架構
Qwen3.8-2.4T-A95B 採用 92 層 hybrid-attention 骨幹:其中只有 23 層跑標準的 full attention(full_attention_interval: 4),其餘 69 層是帶恆定 recurrent state 的線性注意力。這是一個純文字因果語言模型——config.json 內沒有 vision_config,權重索引也找不到任何視覺張量。
官方 API 版 Qwen3.8-Max 才補上 vision 輸入、1M 上下文預設、non-thinking 模式與內建工具。開源版本是「純文字 + thinking 強制開啟」的基座。
512 專家的稀疏 MoE
每個 MoE 層包含 512 個專家,每 Token 動態選 10 個路由專家 + 1 個共享專家——這樣的設計把單 Token 計算量壓在大約 95B dense 等效的水準,但同時擁有 2.4T 的記憶體容量。
- Inference cost:接近 95B dense 模型
- Knowledge capacity:貼近 2.4T dense 模型
- MXFP4(AMD)/ NVFP4 W4A4(NVIDIA Blackwell)量化:可塞進單一節點
多步 MTP 訓練
模型額外做了多步 Multi-Token Prediction 訓練,讓支援 MTP 機制的推理引擎(vLLM、TensorRT-LLM)可以提前預測多個後續 Token,提升 speculative decoding 的命中率。
基準與定位
官方公布的評測涵蓋程式 Agent、通用 Agent、專業工作與長上下文等四大方向,與 Opus 4.8、Fable 5、GPT-5.6 Sol 對比。在 PaperBench、IFBench 等基準上取得所列模型中的較高成績。
幾個值得注意的分數(節錄自官方模型卡):
| Benchmark | Qwen3.8-2.4T-A95B | 同期比較 |
|---|---|---|
| PaperBench | 93 | 同類最高 |
| GPQA Diamond | 92.6 | 接近 Fable 5 |
| Terminal Bench 2.1 | 86.6 | 高於 Opus 4.8 / Fable 5 |
| AndroidBench | 69.8 | 略低於 Fable 5 |
| QwenReactBench | 1694 | 同類最高 |
| MRCR v2 256K(8-needle) | 83.2 | 略低於 Fable 5 |
| LongBench v2 | 69.1 | 同類最高 |
同一時間段內,DeepSeek V4 Pro 正式版也剛上線、Grok 4.6 也發布。三家 frontier 模型同週亮相,把「中國開源 vs. 美國閉源」的競爭直接推到 2.4T 級別。
部署與生態
vLLM Day-0 支援
vLLM 官方 8 月 12 日當天釋出 nightly 版本,已可載入 Qwen3.8-2.4T-A95B。官方推薦推理參數:
temperature=1.0, top_p=0.95, top_k=20,
min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0
硬體需求(以官方模型卡為準):
| 精度 | 權重大小 | 8 × B300(2144 GB) | 8 × MI355X(2304 GB) | 8 × H200(1128 GB) |
|---|---|---|---|---|
| BF16 | 4.45 TiB | 3 節點 | 3 節點 | 6 節點 |
| FP8 | 2.27 TiB | 2 節點 | 2 節點 | 4 節點 |
| MXFP4(AMD) | 1.45 TiB | — | 1 節點 | 2 節點 |
| NVFP4 W4A4(NVIDIA) | 1.32 TiB | 1 節點 | — | 2 節點 |
NVIDIA GB300 NVL72 表現
在 NVIDIA GB300 NVL72 上以 FP8 跑,可達 4K+ tokens/秒/GPU 吞吐量與 350+ tokens/秒/用戶的延遲表現。SGLang 與 NVIDIA Dynamo 也都同步釋出對應的開源部署食譜。
開源社群工具
- Unsloth 1-bit build:把模型進一步量化到 397 GB(已可在單節點載入)
- vLLM Recipes:完整的部署指南已上架 recipes.vllm.ai
- transformers >= 5.4.0 為官方紀錄的最低相依版本
為什麼這件事重要
1. 把「Qwen-Max 等級」從閉源 API 變成可審計的權重
過去 Qwen 系列最高階模型(Qwen3.5-Max、Qwen3.7-Max 等)都只以付費 API 形式提供——研究者要重現 benchmark 必須自己串 API,無法看到完整權重。Qwen3.8-2.4T-A95B 是第一個 Max 等級模型以開源權重形式落地,獨立研究者可以下載、做完整的行為審計、提供者可以在權重之上競爭服務價格,團隊可以重現測試而不是追逐一直在變動的 preview endpoint。
從商業模式來看,這也是阿里第一次用「開源旗艦」打頭陣——過去 OpenAI、Anthropic 的 frontier 模型幾乎從未以原始權重形式放出來過。
2. 開源 vs 閉源的 frontier 差距正在急速收斂
同一週 DeepSeek V4 Pro(1.6T MoE,價格僅 Claude Opus 4.7 的 1/15)、Grok 4.6(AA Index 61 分)、Qwen3.8-2.4T-A95B 三家同時間亮相。從結果來看:
- 程式碼、Agent、長上下文等任務上,開源模型已能在多項 benchmark 與閉源 frontier 並駕齊驅
- 「付費 API 才能跑出 frontier 表現」這個命題正在被改寫
- 真正能自我運行的 frontier 等級模型,部署成本正在快速下降
3. 對開發者的實際影響
對想自部署的開發者,最重要的選擇權衡已經變成:
- 極強的評測表現 ✓
- 激進的 token 定價(Qwen3.8-Max 官方 input $2 / output $6 per 1M)
- 巨大的服務佔地 ✗(單節點就算用 NVFP4 也要 1.32 TiB)
- 可能的授權/管轄區限制 ✗(license metadata 標為「other」,商用前要逐條核對)
對想用 API 的人來說,Qwen3.8-Max 把 frontier 等級的 input token 價格壓到 $2 / 1M——相較 Opus 4.8、Fable 5 這些閉源對手,是實質的價格破壞。
數據解讀與質疑
1. 開源不等於人人能跑
雖然權重放在 Hugging Face 上公開,但 2.4T 模型在 BF16 下要 4.45 TiB 顯存,連 8 × H200 都得 6 節點才能完整跑起來。對大多數個人開發者或小型團隊,實際上仍只能:
- 用 Qwen3.8-Max API(付費)
- 等社群推出 Unsloth 397GB 1-bit build 之類的極端量化版本
- 期待阿里後續釋出 distilled 中型變體(目前還沒有 122B 這種工作站可載的版本)
NVIDIA 開發者論壇上已有用戶反映:「我就想要一個 122B 的 Qwen3.8,這個 2T 版本沒人跑得起來。」這個 gap 是開源策略能否真正落地為社群生產力的關鍵。
2. License 仍待釐清
官方 license metadata 標為「other」,並非 Apache 2.0 或 MIT 等標準開源授權。這意味著:
- 商用限制:部分商業場景可能受限
- 出口/管轄限制:中國廠商模型在歐美部分場景仍需檢查
- 再分發條款:第三方部署商是否可直接提供託管服務,需逐字核對 license
社群已有聲音認為這是「穿著開源外衣的 API 商業模式」——但即便如此,比起純閉源 API,仍是可審計、可下載的進步。
3. Benchmark 與真實工作負載的落差
不論是 Qwen 官方的 PaperBench 93 分,還是 AA Index 的整體分數,目前的 benchmark 都還無法完整捕捉「簡潔清楚的溝通」「跨多天的任務自我管理」「真實軟體工程除錯」這類實戰能力。
Hacker News 上有開發者明確表示:「我常常要把 Claude-Code + Opus-5 換成 Codex + GPT-5.6-sol,整個通訊品質才清爽。當前 benchmark 在這方面有缺。」這個 gap 短期內不會因為任何單一模型的發布而消失。
4. 92 層 hybrid 架構的權衡
23 層 full attention + 69 層線性注意力的設計,能大幅降低長上下文的計算量與記憶體,但同時也限制了「精確檢索」這類對長距離依賴敏感的任務表現。對需要在 256K~1M 上下文中找具體細節的工作(例如大型 codebase 內的精確查找),這個架構是否真能完全取代 full attention,是後續 benchmark 需要重點驗證的點。
參考來源
- Hugging Face 模型卡(第一手出處):https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B
- Qwen 官方部落格(Qwen3.8-Max 發布文):https://qwen.ai/blog?id=qwen3.8
- IT 之家繁中報導:https://www.ithome.com/0/989/001.htm
- vLLM 官方 Day-0 支援公告:https://vllm.ai/blog/2026-08-12-qwen3.8
- NVIDIA Developer Blog(GB300 NVL72 部署指南):https://developer.nvidia.com/blog/serve-qwen3-8-2-4t-a95b-a-2-4t-parameter-model-with-configurable-reasoning-on-nvidia-gb300-nvl72
- vLLM Recipes(部署指南):https://recipes.vllm.ai/Qwen/Qwen3.8-2.4T-A95B
- The New Stack 反應評論:https://thenewstack.io/alibaba-qwen3-8-max-reactions
- Latent.Space AINews 分析:https://www.latent.space/p/ainews-qwen-38-max24t-and-27b-new
- AI WITH Rithes 開箱影片:https://www.youtube.com/watch?v=OzOcY3SJ1FI
網友熱門留言 (3)