← 返回 Siami 首頁

阿里巴巴 Qwen3.8 Max 登上 Agentic Index 榜首:開源旗艦首次擊敗閉源對手

▲ 332 💬 204
阿里巴巴 Qwen3.8 Max 登上 Agentic Index 榜首:開源旗艦首次擊敗閉源對手

編按:本文綜合整理自 Artificial Analysis 官方 Agentic Index 排名、阿里巴巴 Qwen 官方部落格與 X 推文,並加入 Siami 編輯部觀點與分析。


人工智慧評測機構 Artificial Analysis 上週更新了 Agentic Index 排名,阿里巴巴最新旗艦模型 Qwen3.8 Max 從 25 個評測對手中脫穎而出,登上代理能力(agentic capability)榜首。這是首次有「Max 等級」的 Qwen 模型擠下 Anthropic、OpenAI、Google 等閉源對手,登上專門測試真實世界代理任務的分項榜首。

但若看更廣的 Intelligence Index(綜合智力指數),Qwen3.8 Max 排在第五名,分數 56,距離同為開源權重的 Moonshot Kimi K3(57 分)還差一個名次。真正拉開差距的是「代理能力」這個子項目——它衡量模型在真實工作場景中、拿著工具自主完成多步驟任務的本事。


評測結果:代理能力第一、綜合第五

Artificial Analysis 的 Intelligence Index v4.1.1 由四個子項組成:代理能力(34%)、程式設計(24%)、科學推理(24%)、通用能力(18%)。Qwen3.8 Max 在代理能力單項排第一,主要歸功於以下幾個關鍵指標:

  • GDPval-AA Elo:1739 — 比 Moonshot Kimi K3(1685)高 54 分,與 Anthropic Claude Fable 5(1743)、OpenAI GPT-5.6 Sol max(1730)幾乎並列,僅次於 Claude Opus 5 max(1852)
  • 代理任務回合數:64 回合 — 相較於 Qwen3.7 Max 的 14 回合,這也是 Qwen3.8 Max 在 Agentic Index 上躍升 468 Elo 的一部分原因
  • τ³-Banking 工具使用測試:表現穩健,特別在多步驟工具呼叫的準確度上

但回到綜合 Intelligence Index,Qwen3.8 Max 拿到 56 分,與 25 個對手相比排第五。Kimi K3 以 57 分維持開源權重領頭羊地位,閉源模型 Anthropic、OpenAI、Google 則佔據前四名。

Siami 觀察:「代理能力第一、綜合第五」這組排名反映了 2026 年 AI 競賽的核心轉向——模型不再只是回答問題,而是要能在電腦裡自主完成工作。


為什麼這件事重要

這是 Qwen 系列第一次把 Max 等級的模型權重準備開源。在 Qwen3.8 之前,阿里巴巴只開源中小尺寸版本,Max 系列始終以 API 方式獨家提供。

Qwen 官方在部落格寫道:「今天我們正式釋出 Qwen 3.8-Max,這是 Qwen 系列迄今為止最強大的模型。同時也標誌著我們將首次開源一個 Qwen Max 等級的模型——權重將於下週釋出。」不過截至 2026 年 8 月 8 日,權重仍未出現在 Hugging Face 上。

這件事有三層意義:

  1. 開發者可以自架前沿代理模型:以往要跑 Max 等級模型只能透過 API,會受限於 rate limit、按 token 計價、資料出境合規等問題。開源權重讓中小團隊、研究單位可以在自家硬體上跑出接近前沿的代理能力
  2. 中國 AI 實驗室首次在代理榜單上正面擊敗美國閉源對手:這不只是技術指標意義,也代表中國模型在「真實工作場景」這個最實用的賽道上站穩腳跟
  3. 代理任務成本曲線可能會再被壓低:Qwen3.8 Max 在 Intelligence Index 每個任務成本 1.14 美元,比 Qwen3.7 Max 的 0.53 美元貴一倍,但比 Claude Opus 5 max(估計約 3.50 美元/任務)便宜三分之一。開源權重版本若普及,這條成本線會被繼續往下壓

數據解讀:進步是真功夫還是測試紅利?

值得關注的是,Qwen3.8 Max 的 Agentic Index 進步 468 Elo,一部分來自「每個任務跑了 64 個回合」。相較之下,Qwen3.7 Max 平均只跑 14 個回合。

回合數變多會膨脹代理任務的表現分數嗎?會的。Artificial Analysis 自己也在 X 上點出:「這個 468 Elo 的進步,一部分來自新模型每個任務跑更多回合(64 vs. 14)。」這意味著,分數提升有一部分是「更願意窮舉」而非「更聰明」。


另一個值得注意的點是阿里巴巴這次沒有發布任何官方 benchmark 表。沒有 model card、沒有技術報告,只有 2.4 兆參數的數字跟「僅次於 Fable 5」的口號。

第三方獨立評測方面:

  • eesel.ai 實測:在四個相同的 prompt 測試集上,Qwen3.8 Max 拿到 80/100,Kimi K3 是 83/100
  • yottalabs.ai 分析:歸類為「前緣等級、但與 Kimi K3 互有領先」
  • Artificial Analysis 評語:「邊緣性前緣(frontier-class),但還沒明確擊敗 Kimi K3」

換句話說,「僅次於 Fable 5」是阿里巴巴自己說的,目前沒有公開方法論支撐。唯一可信的硬數字是 Agentic Index #1 跟 GDPval-AA 1739 Elo。


HN 社群反應:期待、質疑、實測吐槽

Hacker News 討論串裡開發者分成三派:


期待派(最熱烈):開源權重的承諾讓社群沸騰。「等了 Qwen-Max 開源好久,27B 什麼時候出?」是 top reply 之一。也有開發者準備在 Strix Halo(AMD 高階消費級 APU)上自架 Qwen3.8 Max 27B 參數版本。

質疑派:權重透明 ≠ 原始碼透明。「open weights is not open source. there is no ‘trust’」是常被引用的質疑——沒有訓練資料、沒有訓練流程、沒有 model card,這跟真正的開源精神差很遠。

實測吐槽派:「我用它在幾個專案上測試,發現它其實滿粗心的。會留 bug 在那、不會主動寫測試、也常常理解錯需求。是聰明沒錯,但不夠可靠。」這段評論被點讚 38 次,反映出真實代理場景裡的落差——benchmark 第一名跟生產環境可用,中間還有一大段距離。


進入路徑:Token Plan、Qoder、QoderWork 三條渠道

目前 Qwen3.8 Max 預覽版(qwen3.8-max-preview)透過以下三個阿里巴巴自有渠道提供:

  • Alibaba Cloud Token Plan:模型即服務,按 token 計價
  • Qoder:阿里巴巴的程式設計平台
  • QoderWork:辦公代理終端

定價部分,預覽期間享有日間 1 折、夜間 0.2 折的限時優惠。標準 API 定價為輸入 $2.00/百萬 tokens、輸出 $6.00/百萬 tokens,cached input 僅 $0.25。

至於正式開源版本,Qwen 官方只說「下週」,沒有給出確切日期、license、可用尺寸清單。社群猜測會跟過往 Qwen 系列一樣,提供 Apache 2.0 跟多尺寸(27B、72B、Max),但截至本文撰寫時(2026 年 8 月 8 日 UTC)尚未釋出。


Siami 觀點:代理能力競賽才剛開始

Qwen3.8 Max 在 Agentic Index 登頂,意義不只是「中國模型又贏一次」。它標誌著 AI 競賽的評分標準從「誰答得最準」轉向「誰能在最少監督下完成最多工作」。

接下來值得追蹤的發展:

  • 8 月中下旬 Qwen 開源權重釋出:會用什麼 license?會開出哪些尺寸?會不會被蒸餾出更小的代理能力怪獸?
  • Kimi K3 vs Qwen3.8 Max 開源版本正面對決:兩個中國旗艦在開源權重世界廝殺,會把代理任務的成本曲線往下壓到哪裡?
  • Anthropic、OpenAI、Google 的反應:閉源模型會繼續靠「更多回合、更長 context、更貴推理」拉開差距,還是會被迫調整定價?

代理榜單的排名只是快照,背後是各家實驗室在「真實世界可用性」這條最難的賽道上持續對決。Qwen3.8 Max 暫時領先,但這場比賽沒有終點線。

網友熱門留言 (5)

#1 Hacker News 用戶 ▲ 142
Qwen 團隊首次把 Max 等級的模型開源權重,這對整個 AI 生態會是巨大的衝擊。
#2 Hacker News 用戶 ▲ 87
『開源權重』不是『開源』。沒有訓練資料、沒有訓練流程、沒有 model card,這跟透明完全是兩回事。
#3 Hacker News 用戶 ▲ 64
代理能力分數進步 468 Elo,一部分是因為每個任務跑了 64 輪(之前只跑 14 輪)。多跑幾輪本來就會膨脹分數,不見得代表能力提升。
#4 X 用戶 @y_sofia77 ▲ 41
代理 benchmark 都太狹隘了。真實的代理表現要看多步驟任務出錯後能不能恢復,Qwen3.8-Max 對模糊的工具呼叫到底能不能處理?
#5 Hacker News 用戶 SwellJoe ▲ 38
我用了幾個專案測試,發現它其實滿粗心的。會留 bug 在那、不會主動寫測試、也常常理解錯需求。是聰明沒錯,但不夠可靠。