← 返回 Siami 首頁

阿里巴巴 Qwen3.8-Max 正式發表:2.4 兆參數、首次開源 Max 系列,首週開放權重

▲ 133 💬 48
阿里巴巴 Qwen3.8-Max 正式發表:2.4 兆參數、首次開源 Max 系列,首週開放權重

編按:本文綜合整理自 Qwen 官方部落格Neowin 報導MarkTechPost 分析orcarouter.ai 評測Thomas Wiegold 部落格,並加入 Siami 編輯部觀點與分析。

阿里巴巴旗下的通義千問(Qwen)團隊於 2026 年 8 月 3 日正式發表 Qwen3.8-Max——這是 Qwen 系列迄今最強大的模型,也是 Max 等級首次宣布開源。模型規模達 2.4 兆(2.4T)參數,每次推理激活 95B;在編碼、實務工作、長時程任務、多模態代理四大主軸全面升級,並宣稱可在最少人為介入下,端到端完成複雜長鏈任務。官方已同步啟用 QwenCloud API,模型權重於「下週」釋出至 Hugging Face 與 ModelScope。


為什麼這件事重要

2026 年開源旗艦模型的軍備競賽已經打到「兆級」門檻。Moonshot AI 在 7 月底開源 2.8T 參數的 Kimi K3,緊接著 Qwen 端出 2.4T 的 Qwen3.8-Max——兩家中國 AI 公司在不到兩週內接連衝破開源參數量天花板。更值得注意的是,這是 Alibaba Qwen 第一次把 Max 等級模型開源,等於把原本只鎖在 API 後的旗艦能力釋出給開發者社群。

對中文 AI 應用開發圈來說,這影響的不只是模型選擇,更是「能不能離線部署這個等級的能力」——一旦權重釋出,企業自建、私有雲、邊緣部署都成為可能,不必再為每 token 付 API 費。


編碼能力:16 天無人介入的自我演化

官方這次用三個「無人介入」的編碼實測來展示模型能力。最具話題性的是 oh-my-cli 專案:給模型一個空的 repo,讓它跑 16 天,自己設計 task state machine、dispatcher、watchdog,從使用者回饋、進階社群實務、模型自我測試結果三個訊號源持續迭代。截至 2026 年 7 月 30 日,repo 已累積 265 個 commits、127 個 PR、151 個 issue

第二個案例是 重現 + 改進論文:給模型一篇「Unified Data Selection for LLM Reasoning」的研究論文,從零開始重現實驗——約 5 天、7,600 行程式、1,100 個動作、33 輪 GPU 訓練,完整重現論文六項發現(含 AIME24 比隨機資料挑選 +7.7% 的關鍵結論)。接著模型自行啟動「假設→寫程式→執行→分析→重來」的研究迴圈,連續跑了 4 輪、提出 18 個改良想法,最終發展出比原論文還好的方法——AIME24 上 +2.7 分

第三個是把模型丟進 天池的 WWW2025 多模態對話意圖辨識競賽,跟 526 隊真人隊伍同場競技。模型 24 小時內從零讀完規則、自己組合 BERT、MacBERT、RoBERTa 三個文本模型加 Qwen2.5-VL-7B 視覺模型,再加 Chinese-CLIP,最終以 0.853 準確率擊敗 458 隊(87% 的參賽者)。


實務工作:百種職業的真實工作流

Qwen 團隊把模型丟進「幾百種高經濟價值職業」做壓力測試,並列舉六個具體案例:

  • 企業法務合規:在單次掃描中,於上百份文件裡挑出 1,284 條相關條款,原本需要律師團隊協作一週的工作,一小時內完成。
  • UI/UX 設計師:為數位銀行 NOVA 一次產出 8 個螢幕的高擬真互動原型,零輪人工修改;傳統工作流通常需要 3 到 5 輪修訂。
  • 餐飲品牌創辦人:讀完上百份食材供應簡報後,一次產出 26 道菜的完整菜單,每道標註熱量與食材來源,食材成本佔比控制在 33.8%。
  • 結構工程師:僅憑一組圖面,在瀏覽器內重建 30 層辦公大樓的地震結構模型,可即時檢視自然週期、基底剪力、層間位移比。
  • 復健治療師:把 2D 紙本評估表變成可任意旋轉、含分層解剖覆蓋的 3D 互動 demo,原本需要醫療動畫公司 2-4 週工期。
  • 運動數據分析師:每位球員約 8,400 次攻守回合,幾十分鐘內變成可用的球員戰術側寫與教練報告。

另一條主軸是 Dynamic Workflows:模型從六段簡短描述(動能、價值、品質、投資、低風險、情緒)自動分解成 50 個研究方向,派出約 330 個子代理,完成約 6,000 次回測——選出的因子達成超額夏普值 0.64 到 1.48,IC 一致為正(0.010 到 0.014)。


長時程任務:自主晶片設計到 365 天電商模擬

官方報告中兩個最極端的長時程案例特別值得展開。

自主晶片設計:模型從基本任務描述、空白的 RTL 模板、驗證評估腳本出發,在整合 Iverilog、Yosys、OpenROAD 工具鏈的沙盒中全自動執行 500 輪、71 次評估、跨越 13 個里程碑,把 GCD/RSA 密碼加速器的閘數從初始的 8,298 門一路壓到 678 門(92% 縮減)。實體佈局從 106×106 µm² 縮到 46×46 µm²(81% 面積縮減),500 MHz 時序收斂。

關鍵的里程碑算法層級重構:

階段輪次閘數核心動作
起始8,298初始可運行設計
算法重寫Turn 222,010模除法器改為迭代位移相減(單步省 6,288 門,佔總減量 80%)
冗餘消除Turns 35–481,304繞過 REDUCE 階、合併獨立模組、優化輸出路徑
暫存器與 FSM 剪枝Turns 60–113907移除冗餘 base/mod 暫存器、合併比較-減法邏輯
模組融合Turns 170–252765把乘法器直接內嵌進模冪 FSM
閘級精修Turns 443–500678共用 NOR 樹、絕對差分割、byte-to-bit 選擇

365 天電商模擬(E-Commerce Bench):模型拿到 10 萬人民幣起始資金,要同時營運多家線上商店,面對 12 種店型、60 個品類、近 600 個供應商、7,000 個商品,還要應付季節性需求波動、颱風等供應鏈危機、年終大促。Qwen3.8-Max 最終以 ¥416,252(4.16 倍報酬)收盤,比第二名 GLM 5.2 高出 38%,比它的前一代 Qwen3.7-Max 強 152%。


Benchmark:跑贏 Opus 4.8,部分項目超越 Fable 5 與 GPT-5.6 Sol

官方公布的完整榜單橫跨四個類別,最值得看的是 Qwen3.8-Max 在以下項目達到 SOTA 或接近頂標:

  • PaperBench:93.0(Fable 5 88.8 / GPT-5.6 Sol 90.5 / Opus 4.8 80.3)——第一名
  • MathVision:95.2 / 97.7(Fable 5 92.7 / 98.6)
  • BabyVision:82.0 / 91.3(Fable 5 42.5 / 90.5)——大幅領先
  • ZeroBench:24.0 / 49.0(Opus 4.8 17.0 / 34.0)——跑贏 Opus
  • OSWorld-Verified:86.1(Fable 5 85.0)
  • Parametric CAD Bench:91.5(Fable 5 87.5)
  • PerceptionBench:63.5(對比組中最高)
  • CountQA:82.4(Fable 5 63.1)——領先近 20 分

但同一張榜上也有不少 Qwen 落後的項目:Terminal Bench 2.1 86.6 仍輸 GPT-5.6 Sol 的 88.8;SWE-bench Pro 67.7 遠低於 Fable 5 的 80.0;DeepSWE 1.1 56.6 也不到 Fable 5 70.0 的八成;HLE w/ tools 56.2 落後 Fable 5 的 64.5。也就是說,整體表現「夠強」但不是全面碾壓,仍有特定 benchmark 被對手壓著打。


多模態代理與 API 整合

Qwen3.8-Max 的視覺不再只是輸入端的「另一種模態」——而是貫穿規劃、執行、驗證、迭代的原生回饋迴圈。模型在執行過程會持續觀察自己的中間結果,發現電視方向錯誤、介面錯位、視覺成果與設計意圖不符時,能自主識別偏差、修正計畫、調整輸出。

官方推出 Qwen-MM-Plugins 這個開源外掛庫,讓既有的代理框架能擴充影像與影片處理、多模態記憶、動態解析度、視覺工具調用、影片編輯、Blender、CAD 等專門能力。

API 層面,模型在 QwenCloud 提供 reasoning_effort 參數切換(xhigh / medium / low 三段),預設啟用 preserve_thinking。相容 OpenAI Chat Completions、Anthropic 規格、Hermes Agent 框架,並能直接整合 Claude Code、Codex、Qoder、OpenClaw、Qwen Code CLI 等主流代理工具鏈。Context window 100 萬 token、最大輸出 65,536 token


Siami 觀點:開源旗艦的真實意義

Qwen3.8-Max 的關鍵意義在於它把 Max 等級的旗艦模型開源。歷史上 Aliyun 通義一直把 Max 系列鎖在 API 後,開發者只能用 Plus 或更小的層級;這次 2.4T 參數的 Qwen3.8-Max 釋出權重,等於讓企業可在自己的硬體上跑這個等級的能力,不必再為每 token 付出 API 成本。

對於台灣與國際的中文應用開發圈,這尤其重要。過去一年 Claude 與 GPT 的頂規模型對中文任務常有微妙的文化偏差,Qwen 系列在中文語料、簡繁中文轉換、台灣用語上有結構性優勢。Qwen3.8-Max 一旦開源,本地化部署會大幅加速——從客服機器人、法律文件審查到中文教育應用,都有了可離線、可自建的旗艦選項。

但官方目前仍有幾個地方沒交代清楚:Terminal Bench 2.1、PaperBench 等自家基準是否被獨立第三方重現?preview 期 $3/$15 per million tokens 的暫訂價,正式商用價是多少?Apache 2.0 還是其他開源授權?2.4T 模型離線部署的硬體需求(GPU 數量、記憶體、推論引擎)?這些都要等下週權重釋出時一起揭曉。


業界反應與待觀察

社群在 Hacker News 上對這則發表的討論集中在三個點:①Benchmark 透明度——官方表格漂亮,但部分基準(CoWorkBench、QwenSWEBench、QwenReactBench)是 Qwen 自家內部測試,獨立驗證仍是黑盒子;②開源節奏——Moonshot Kimi K3、Qwen3.8-Max 兩週內接連開源,2026 下半年中國 AI 旗艦「開源即行銷」的策略已成形;③西方社群對齊審查疑慮——Simon Willison 等測評者已注意到 Qwen 系列內建敏感政治話題審查機制,企業導入前需先評估使用情境。

對開發者而言,下週(2026 年 8 月中)的權重釋出才是真正的關鍵節點。建議追蹤:

  • Hugging Face Qwen/Qwen3.8-Max 的 model card 與授權條款
  • 商用 API 定價正式公告
  • 開源社群的前 24 小時 benchmark 重現結果
  • 能否與現有 vLLM、SGLang、TensorRT-LLM 推論引擎整合

網友熱門留言 (5)

#1 Hacker News 社群 0
「From my testing it appears they're still fiddling with it in the back end a lot. I've had wildly different quality outputs and speeds.」第三方實測顯示模型仍在後台頻繁調整,輸出品質與速度不穩定。
#2 Thomas Wiegold 部落格評論 0
「Qwen models carry baked-in CCP-aligned guardrails on politically sensitive topics.」Simon Willison 等多位獨立測評者已記錄 Qwen 模型內建敏感政治話題審查機制,使用上需注意。
#3 MarkTechPost 編輯分析 0
「How X, Reddit and Hacker News reacted to Qwen3.8-Max-Preview. A qualitative read of public discussion in the hours after the July 19 ...」在 preview 階段,社群關注聚焦在 Benchmark 透明度與開源時程,普遍肯定 Coding 與 Work 表現,但質疑缺乏獨立第三方驗證表格。
#4 Neowin 報導 0
「Alibaba's Qwen3.8-Max outperforming Fable 5 and GPT-5.6 Sol, across 7 coding and general evaluation tasks and 36 multimodal ...」在 7 項編碼與綜合評測、36 項多模態任務上超越 Fable 5 與 GPT-5.6 Sol。
#5 Siami 編按 0
官方未公開:①Terminal-Bench 2.1 等自家基準的獨立第三方重現 ②API 商用定價(preview 期 $3/$15 per million tokens 為暫訂,正式價尚未公布)③開源權重採用 Apache 2.0 或其他授權 ④是否能離線部署 2.4T 模型的硬體需求。