← 返回 Siami 首頁

中國 Z.ai 開源模型 GLM-5.2 登頂 Artificial Analysis 指數 744B 參數幹掉 DeepSeek、Kimi

▲ 510 💬 272
中國 Z.ai 開源模型 GLM-5.2 登頂 Artificial Analysis 指數 744B 參數幹掉 DeepSeek、Kimi

編按:本文綜合整理自 Artificial AnalysisHugging Face 模型卡Z.ai 官方文件LLM Stats 統計頁,並加入 Siami 編輯部觀點與分析。

中國 AI 實驗室 Z.ai(前身為智譜 AI)於 6 月 16 日正式釋出 GLM-5.2 旗艦模型。根據第三方基準機構 Artificial Analysis 6 月 17 日的最新評測,GLM-5.2 在「Intelligence Index v4.1」拿下 51 分,正式超越美國封閉源頭部模型,成為目前分數最高的開源權重(open weights)模型

為什麼這件事重要

這是中國開源大模型在 2026 年上半年的關鍵一役。短短兩個月內,Z.ai 的 GLM-5.1 在 4 月搶下 SWE-Bench Pro 榜首,GLM-5.2 接力在 Artificial Analysis 的綜合指數(涵蓋科學推理、編碼、智慧體任務)全面登頂,意味著中國「開源派」與美國「封閉派」之間的差距,已經從「接近」走到「實質並駕齊驅」。

更深層的訊號是 「開源權重」這個概念的政治意涵。Z.ai 創辦人唐杰在 X 平台上發布的官方聲明,把開源定位為「AGI 應為全人類的基石,而非少數規則壟斷的可撤銷特權」,明確指向近期部分前沿模型因地緣政治因素被限制存取的事件。換言之,開源不只是商業策略,已成為 AI 治理領域的地緣政治工具

核心數據:GLM-5.2 與同級模型比較

依 Artificial Analysis Intelligence Index v4.1(滿分約 100)排名:

模型開發者Intelligence Index授權備註
GLM-5.2Z.ai(中國)51MIT開源權重 SOTA
MiniMax-M3Anthropic44封閉上次榜首
DeepSeek V4 Pro (max)DeepSeek(中國)44開源並列第二
Kimi K2.6Moonshot(中國)43開源略遜
GLM-5.1Z.ai(中國)40MIT前一代

各項基準的進步幅度(GLM-5.2 vs GLM-5.1)

  • 科學推理 — CritPt:+16 點(達 21%)
  • HLE(Humanity’s Last Exam):+12 點(達 40%)
  • AA-LCR 長脈絡推理:+9 點(達 71%)
  • tau3 banking 領域基準:+15 點(達 27%)
  • SciCode 程式碼科學問題:+7 點(達 50%)
  • TerminalBench v2.1 終端機代理:+16 點(達 78%)
  • GPQA Diamond(博士級問答):+3 點(達 89%)

GDPval-AA v2 代理實戰(最關鍵指標)

這是 Artificial Analysis 的「真實世界智慧體工作」基準,模擬經濟中真正有價值的知識工作任務:

  • GLM-5.2:1524 分(超越同級所有開源模型)
  • MiniMax-M3:1418
  • DeepSeek V4 Pro (max):1328
  • GPT-5.5(xhigh reasoning):1514(封閉源頭部模型之一,與 GLM-5.2 幾乎打平

「GLM-5.2 在 GDPval-AA v2 的表現,實質上已與 GPT-5.5 的高推理模式並駕齊驅。這是開源模型首次在『真實世界代理工作』這個最嚴苛的基準上逼近封閉源前沿。」— Artificial Analysis 編輯部

模型規格

項目GLM-5.2對比 GLM-5.1
總參數量744B744B(不變)
啟動參數(active)40B40B(不變)
脈絡長度1M tokens200K tokens(5 倍提升
輸入價格$1.4 / 1M tokens$1.4 / 1M tokens
快取命中價格$0.26 / 1M tokens$0.26 / 1M tokens
輸出價格$4.4 / 1M tokens$4.4 / 1M tokens
授權MITMIT

注意:總參數量沒變,5 倍脈絡長度提升全部來自訓練優化(推測為 Dynamic Sparse Attention 與長脈絡微調),這是工程上相當不容易的成果。

為什麼 GLM-5.2 變聰明了? — 數據解讀

1. 推理預算大幅增加,但 token 效率下降

GLM-5.2 平均每個 Intelligence Index 任務用掉 4.3 萬個輸出 token,其中 3.7 萬是推理 token。相比 GLM-5.1 的 2.6 萬,這是 +65% 的 token 消耗成長

對照同級開源模型:

  • DeepSeek V4 Pro (max):3.7 萬
  • Kimi K2.6:3.5 萬
  • MiniMax-M3:2.4 萬(最節省)

這代表 GLM-5.2 是用「暴力推理換分數」的策略 — 它在「Intelligence vs Output Tokens」圖上位於較不利的象限。對企業用戶來說,雖然單價不變,但每個任務實際花費會比對手貴 60-80%

2. 智慧指數提升的邊際成本上升

模型Intelligence Index每任務成本(美元)成本 / 分數比
DeepSeek V4 Pro (max)44$0.05$0.0011(最便宜)
MiniMax-M344$0.18$0.0041
Kimi K2.643$0.31$0.0072
GLM-5.140$0.25$0.0063
GLM-5.251$0.46$0.0090(最貴)

GLM-5.2 雖然聰明,但每提升 1 分的邊際成本是 DeepSeek 的 8 倍。這就是為什麼 Artificial Analysis 仍把它列為 Pareto frontier(智慧-成本最佳前沿)— 因為它在自身智慧層級中成本最低,但跟低階模型比絕對費用仍是高的。

3. 幻覺率有改善

AA-Omniscience Index(測試模型會不會在不知道的問題上胡說)從 GLM-5.1 的 2 分提升到 4 分:

  • 準確率:24.2% → 25.1%
  • 幻覺率:29.4% → 28.1%(下降 1.3 個百分點)
  • 嘗試回答率:47% → 47%(持平)

改善幅度有限,OpenAI 與 Anthropic 在這項指標上仍明顯領先(多在 60-70 分),GLM-5.2 在「知道自己不知道」這件事上還有很長的路。

🚨 質疑:為什麼這個第一名有保留?

雖然 Artificial Analysis 的評測極具公信力,但讀者應注意以下幾點:

1. 「真實世界代理」基準的爭議

GDPval-AA v2 的本質是「用 AI 評審團評 AI 完成的經濟任務」,這引發一個根本問題:評審模型本身就是前沿 AI,會不會有評分偏誤?Artificial Analysis 在 v2 中聲明已改用「輪換評審團」(rotating panel of frontier-model judges)來緩解,但仍無法完全排除「同類模型互捧」的可能。

2. 推理 token 暴增的成本真相

GLM-5.2 用 +65% 的 token 換 +11 分(40 → 51),換算下來每分成本其實是上升的。但官方定價沒變,這代表 Z.ai 正在用毛利率換市場份額。一旦 Anthropic 或 OpenAI 祭出更便宜的開源模型,Z.ai 的單位經濟會快速惡化。

3. MIT 授權背後的中國國資疑慮

Z.ai(智譜 AI)的投資人包括多家中國國有資本,雖然 MIT 授權是真實的(任何人都可下載、商用、修改),但實務上西方企業使用中國國資背景的開源模型,仍面臨越來越多的法規審查(例如美國 BIS 的出口管制名單、歐盟 AI Act 的供應鏈盡職調查)。這在 6 月稍早 Reuters 報導的「美方暫緩將 DeepSeek 等 100 多家中國 AI 公司列入實體清單」事件中可見端倪。

4. 與 Fable 5 的代差

6 月 9 日 Anthropic 釋出的 Claude Fable 5 才是當前 SOTA(Intelligence Index 接近 60,領先所有模型 5 分以上)。GLM-5.2 的 51 分代表 它只是「開源 SOTA」,不是「整體 SOTA」。Fable 5 的爭議在於「突襲式權限縮減」(過去購買的方案被限縮),這正是 Z.ai 創辦人聲明中暗示的事件。


開源生態衝擊

GLM-5.2 的釋出對開源社群意義重大:

  • MIT 授權的延續:GLM-5 全系列(5.0、5.1、5.2)都保持 MIT,這是頭部模型中最一致的開源承諾
  • 多平台部署:除官方 API 外,DeepInfra、Novita、Nebius、Parasail、Siliconflow、GMI Cloud、Baseten、Fireworks 等 8 家第三方平台同步上線
  • Hugging Face 開放下載zai-org/GLM-5.2 已是 Hugging Face 熱門模型

「身為一個開源社群參與者,我特別感謝中國實驗室在這個時刻的開源承諾。」— HN 用戶 Reubend(GLM 5.2 Is Out 討論串,729 推)

結論:開源 SOTA 的里程碑,距離整體 SOTA 仍有 5 分差距

GLM-5.2 的 51 分是開源權重模型的新紀錄,超過了所有同類競爭者(包括同為中國的 DeepSeek V4 Pro 與 Kimi K2.6),甚至在「真實世界代理工作」上逼近 GPT-5.5 的高推理模式。

但讀者不應過度解讀:

  1. 與封閉源頭部(Fable 5)仍有 5 分以上差距
  2. 成本效率不如 DeepSeek,每個任務實際花費貴 8 倍
  3. 地緣政治風險讓西方企業的採用仍有不確定性

對 Siami 讀者的實務建議:

  • 如果你是獨立開發者或新創,GLM-5.2 加上 Hugging Face 上的開源權重,是目前性價比最高的開源前沿模型之一
  • 如果你在企業環境部署,DeepSeek V4 Pro (max) 在成本效率上仍是更穩定的選擇
  • 如果你要做長脈絡任務(百萬級 token 的程式碼庫分析、文件審閱),GLM-5.2 的 1M 脈絡是真實可用的,比 GLM-5.1 的 200K 提升顯著

資料來源