編按:本文綜合整理自 Artificial Analysis、Hugging Face 模型卡、Z.ai 官方文件 與 LLM Stats 統計頁,並加入 Siami 編輯部觀點與分析。
中國 AI 實驗室 Z.ai(前身為智譜 AI)於 6 月 16 日正式釋出 GLM-5.2 旗艦模型。根據第三方基準機構 Artificial Analysis 6 月 17 日的最新評測,GLM-5.2 在「Intelligence Index v4.1」拿下 51 分,正式超越美國封閉源頭部模型,成為目前分數最高的開源權重(open weights)模型。
為什麼這件事重要
這是中國開源大模型在 2026 年上半年的關鍵一役。短短兩個月內,Z.ai 的 GLM-5.1 在 4 月搶下 SWE-Bench Pro 榜首,GLM-5.2 接力在 Artificial Analysis 的綜合指數(涵蓋科學推理、編碼、智慧體任務)全面登頂,意味著中國「開源派」與美國「封閉派」之間的差距,已經從「接近」走到「實質並駕齊驅」。
更深層的訊號是 「開源權重」這個概念的政治意涵。Z.ai 創辦人唐杰在 X 平台上發布的官方聲明,把開源定位為「AGI 應為全人類的基石,而非少數規則壟斷的可撤銷特權」,明確指向近期部分前沿模型因地緣政治因素被限制存取的事件。換言之,開源不只是商業策略,已成為 AI 治理領域的地緣政治工具。
核心數據:GLM-5.2 與同級模型比較
依 Artificial Analysis Intelligence Index v4.1(滿分約 100)排名:
| 模型 | 開發者 | Intelligence Index | 授權 | 備註 |
|---|---|---|---|---|
| GLM-5.2 | Z.ai(中國) | 51 | MIT | 開源權重 SOTA |
| MiniMax-M3 | Anthropic | 44 | 封閉 | 上次榜首 |
| DeepSeek V4 Pro (max) | DeepSeek(中國) | 44 | 開源 | 並列第二 |
| Kimi K2.6 | Moonshot(中國) | 43 | 開源 | 略遜 |
| GLM-5.1 | Z.ai(中國) | 40 | MIT | 前一代 |
各項基準的進步幅度(GLM-5.2 vs GLM-5.1)
- 科學推理 — CritPt:+16 點(達 21%)
- HLE(Humanity’s Last Exam):+12 點(達 40%)
- AA-LCR 長脈絡推理:+9 點(達 71%)
- tau3 banking 領域基準:+15 點(達 27%)
- SciCode 程式碼科學問題:+7 點(達 50%)
- TerminalBench v2.1 終端機代理:+16 點(達 78%)
- GPQA Diamond(博士級問答):+3 點(達 89%)
GDPval-AA v2 代理實戰(最關鍵指標)
這是 Artificial Analysis 的「真實世界智慧體工作」基準,模擬經濟中真正有價值的知識工作任務:
- GLM-5.2:1524 分(超越同級所有開源模型)
- MiniMax-M3:1418
- DeepSeek V4 Pro (max):1328
- GPT-5.5(xhigh reasoning):1514(封閉源頭部模型之一,與 GLM-5.2 幾乎打平)
「GLM-5.2 在 GDPval-AA v2 的表現,實質上已與 GPT-5.5 的高推理模式並駕齊驅。這是開源模型首次在『真實世界代理工作』這個最嚴苛的基準上逼近封閉源前沿。」— Artificial Analysis 編輯部
模型規格
| 項目 | GLM-5.2 | 對比 GLM-5.1 |
|---|---|---|
| 總參數量 | 744B | 744B(不變) |
| 啟動參數(active) | 40B | 40B(不變) |
| 脈絡長度 | 1M tokens | 200K tokens(5 倍提升) |
| 輸入價格 | $1.4 / 1M tokens | $1.4 / 1M tokens |
| 快取命中價格 | $0.26 / 1M tokens | $0.26 / 1M tokens |
| 輸出價格 | $4.4 / 1M tokens | $4.4 / 1M tokens |
| 授權 | MIT | MIT |
注意:總參數量沒變,5 倍脈絡長度提升全部來自訓練優化(推測為 Dynamic Sparse Attention 與長脈絡微調),這是工程上相當不容易的成果。
為什麼 GLM-5.2 變聰明了? — 數據解讀
1. 推理預算大幅增加,但 token 效率下降
GLM-5.2 平均每個 Intelligence Index 任務用掉 4.3 萬個輸出 token,其中 3.7 萬是推理 token。相比 GLM-5.1 的 2.6 萬,這是 +65% 的 token 消耗成長。
對照同級開源模型:
- DeepSeek V4 Pro (max):3.7 萬
- Kimi K2.6:3.5 萬
- MiniMax-M3:2.4 萬(最節省)
這代表 GLM-5.2 是用「暴力推理換分數」的策略 — 它在「Intelligence vs Output Tokens」圖上位於較不利的象限。對企業用戶來說,雖然單價不變,但每個任務實際花費會比對手貴 60-80%。
2. 智慧指數提升的邊際成本上升
| 模型 | Intelligence Index | 每任務成本(美元) | 成本 / 分數比 |
|---|---|---|---|
| DeepSeek V4 Pro (max) | 44 | $0.05 | $0.0011(最便宜) |
| MiniMax-M3 | 44 | $0.18 | $0.0041 |
| Kimi K2.6 | 43 | $0.31 | $0.0072 |
| GLM-5.1 | 40 | $0.25 | $0.0063 |
| GLM-5.2 | 51 | $0.46 | $0.0090(最貴) |
GLM-5.2 雖然聰明,但每提升 1 分的邊際成本是 DeepSeek 的 8 倍。這就是為什麼 Artificial Analysis 仍把它列為 Pareto frontier(智慧-成本最佳前沿)— 因為它在自身智慧層級中成本最低,但跟低階模型比絕對費用仍是高的。
3. 幻覺率有改善
AA-Omniscience Index(測試模型會不會在不知道的問題上胡說)從 GLM-5.1 的 2 分提升到 4 分:
- 準確率:24.2% → 25.1%
- 幻覺率:29.4% → 28.1%(下降 1.3 個百分點)
- 嘗試回答率:47% → 47%(持平)
改善幅度有限,OpenAI 與 Anthropic 在這項指標上仍明顯領先(多在 60-70 分),GLM-5.2 在「知道自己不知道」這件事上還有很長的路。
🚨 質疑:為什麼這個第一名有保留?
雖然 Artificial Analysis 的評測極具公信力,但讀者應注意以下幾點:
1. 「真實世界代理」基準的爭議
GDPval-AA v2 的本質是「用 AI 評審團評 AI 完成的經濟任務」,這引發一個根本問題:評審模型本身就是前沿 AI,會不會有評分偏誤?Artificial Analysis 在 v2 中聲明已改用「輪換評審團」(rotating panel of frontier-model judges)來緩解,但仍無法完全排除「同類模型互捧」的可能。
2. 推理 token 暴增的成本真相
GLM-5.2 用 +65% 的 token 換 +11 分(40 → 51),換算下來每分成本其實是上升的。但官方定價沒變,這代表 Z.ai 正在用毛利率換市場份額。一旦 Anthropic 或 OpenAI 祭出更便宜的開源模型,Z.ai 的單位經濟會快速惡化。
3. MIT 授權背後的中國國資疑慮
Z.ai(智譜 AI)的投資人包括多家中國國有資本,雖然 MIT 授權是真實的(任何人都可下載、商用、修改),但實務上西方企業使用中國國資背景的開源模型,仍面臨越來越多的法規審查(例如美國 BIS 的出口管制名單、歐盟 AI Act 的供應鏈盡職調查)。這在 6 月稍早 Reuters 報導的「美方暫緩將 DeepSeek 等 100 多家中國 AI 公司列入實體清單」事件中可見端倪。
4. 與 Fable 5 的代差
6 月 9 日 Anthropic 釋出的 Claude Fable 5 才是當前 SOTA(Intelligence Index 接近 60,領先所有模型 5 分以上)。GLM-5.2 的 51 分代表 它只是「開源 SOTA」,不是「整體 SOTA」。Fable 5 的爭議在於「突襲式權限縮減」(過去購買的方案被限縮),這正是 Z.ai 創辦人聲明中暗示的事件。
開源生態衝擊
GLM-5.2 的釋出對開源社群意義重大:
- MIT 授權的延續:GLM-5 全系列(5.0、5.1、5.2)都保持 MIT,這是頭部模型中最一致的開源承諾
- 多平台部署:除官方 API 外,DeepInfra、Novita、Nebius、Parasail、Siliconflow、GMI Cloud、Baseten、Fireworks 等 8 家第三方平台同步上線
- Hugging Face 開放下載:zai-org/GLM-5.2 已是 Hugging Face 熱門模型
「身為一個開源社群參與者,我特別感謝中國實驗室在這個時刻的開源承諾。」— HN 用戶 Reubend(GLM 5.2 Is Out 討論串,729 推)
結論:開源 SOTA 的里程碑,距離整體 SOTA 仍有 5 分差距
GLM-5.2 的 51 分是開源權重模型的新紀錄,超過了所有同類競爭者(包括同為中國的 DeepSeek V4 Pro 與 Kimi K2.6),甚至在「真實世界代理工作」上逼近 GPT-5.5 的高推理模式。
但讀者不應過度解讀:
- 與封閉源頭部(Fable 5)仍有 5 分以上差距
- 成本效率不如 DeepSeek,每個任務實際花費貴 8 倍
- 地緣政治風險讓西方企業的採用仍有不確定性
對 Siami 讀者的實務建議:
- 如果你是獨立開發者或新創,GLM-5.2 加上 Hugging Face 上的開源權重,是目前性價比最高的開源前沿模型之一
- 如果你在企業環境部署,DeepSeek V4 Pro (max) 在成本效率上仍是更穩定的選擇
- 如果你要做長脈絡任務(百萬級 token 的程式碼庫分析、文件審閱),GLM-5.2 的 1M 脈絡是真實可用的,比 GLM-5.1 的 200K 提升顯著
資料來源: