編按:本文綜合整理自 Artificial Analysis 官方分析、Z.ai 官方公告、Hugging Face 模型卡,並加入 Siami 編輯部觀點與分析。
中國 AI 實驗室智譜(Z.ai)於 6 月 13 日悄悄把 GLM-5.2 開源上架,沒有發表會、沒有 PR 稿,但這個 744B 參數的 Mixture-of-Experts 模型一上線就把 Artificial Analysis Intelligence Index 開源榜第一名的寶座直接拿下來。6 月 17 日 Artificial Analysis 正式發表分析報告,分數 51,比自家前代 GLM-5.1 整整高出 11 分,並且正式追上閉源旗艦 GPT-5.5(xhigh reasoning)的水準。
開源霸主換人坐
在 GLM-5.2 之前,開源榜首一直由 DeepSeek、Kimi K2.6、GLM-5.1 三家輪流當老大。Artificial Analysis 這次把榜單重新洗牌:
| 模型 | 總參數 | 啟用參數 | Intelligence Index v4.1 |
|---|---|---|---|
| GLM-5.2 | 744B | 40B | 51 |
| MiniMax-M3 | — | — | 44 |
| DeepSeek V4 Pro(max) | 1600B | 49B | 44 |
| Kimi K2.6 | 1000B | 32B | 43 |
GLM-5.2 跟 GLM-5.1 架構一模一樣(都是 744B 總參數、40B 啟用參數),能在參數規模完全沒變的情況下把分數拉高 11 分,這代表這次升級幾乎是純訓練 + 後訓練工藝的勝利,而不是靠硬堆參數換效能。
真正的戰場:科學推理 + Agent 能力
GLM-5.2 不是每個 benchmark 都有進步,但進步的地方全都是 AI Agent 真正會用到的能力:
- CritPt(科學推理)+16 → 21%
- HLE(Humanity’s Last Exam)+12 → 40%
- AA-LCR(長上下文推理)+9 → 71%
- SciCode(科學程式設計)+7 → 50%
- tau3 banking(金融工具呼叫)+15 → 27%
- TerminalBench v2.1(終端機 agent)+16 → 78%
- GPQA Diamond(博士級科學題)+3 → 89%
最值得看的是 GDPval-AA v2 分數 1524,這個分數是 Artificial Analysis 用來評估「真實世界長時程知識工作」的指標,GLM-5.2 跟 GPT-5.5(xhigh reasoning, 1514)幾乎平手,而且把 MiniMax-M3(1418)、DeepSeek V4 Pro max(1328)都壓在腳下。這是開源模型第一次在 agentic real-world 任務上跟閉源旗艦打平。
為什麼這件事重要
GLM-5.2 上線這週,正好撞上 OpenAI / Anthropic 對部分用戶祭出存取限制的敏感時機。智譜創辦人直接在 X 上開嗆:「frontier intelligence belongs to everyone」。這不只是行銷話術,是有實質意義的:
-
MIT 授權 + 1M context + 第三方 providers 全部到位:DeepInfra、Novita、Nebius、Parasail、Siliconflow、GMI Cloud、Baseten、Fireworks 八家國際 inference 平台同步上線,開發者不必直接連智譜 API也能用。
-
架構創新 IndexShare:智譜把 1M context 的 sparse attention indexer 在每 4 層之間共用,1M context 的 per-token FLOPs 直接降 2.9 倍。同時 MTP(Multi-Token Prediction)層優化讓 speculative decoding 接受長度提升 20%。
-
價格破壞:官方 API 維持 $1.4 / 4.4 / 0.26 per 1M input / output / cache hit,跟 GLM-5.1 持平。在同等 intelligence 等級的模型裡,GLM-5.2 是 cost per task 最低的開源模型($0.46 / task)。
-
回應 Z.ai 創辦人說的「open weights, open access」:在歐美開始對閉源 frontier model 限縮存取、調漲 API 價格的當下,中國開源陣營直接端出「不必找我們、不必付訂閱、自己 host 也行」的替代方案,這是地緣政治 + AI 商業模式的雙重訊號。
數據解讀 / 質疑
Artificial Analysis 自己點出了三個**「不太漂亮」的數字**,Siami 認為這些才是真正該被誠實看待的:
-
Token 效率是開源榜最差:GLM-5.2 每個 Intelligence Index 任務用掉 43k output tokens,其中 37k 是 reasoning。比 GLM-5.1(26k)多 65%,比 MiniMax-M3(24k)多 79%,比 Kimi K2.6(35k)多 23%。在「Intelligence vs Output Tokens」圖上,它落在最不漂亮的那個象限。
-
每任務成本看起來漂亮但其實不便宜:$0.46 / task 雖然是同等 intelligence 級距最低,但比自家前代 GLM-5.1 的 $0.25 貴了 84%、比 DeepSeek V4 Pro max 的 $0.05 貴了 9 倍。如果用戶在意的是 CP 值,DeepSeek V4 Pro max 仍然是真正的性價比王者。
-
AA-Omniscience Index(反幻覺指標)只有 4 分:進步來自準確率(25.1% → 25.1% 幾乎持平)跟幻覺率(29.4% → 28.1%)的小幅改善,attempt rate 維持 47% 不變。幻覺率仍然接近 30%,對醫療、法律等高風險應用來說還不夠。
-
Z.ai 公告沒附 benchmark 表格:跟上個月 DeepSeek V4 Pro 公佈時直接給出 12 個 benchmark 對比表相比,智譜這次幾乎是「先上車、後補票」。Artificial Analysis 的數字是目前唯一的權威第三方驗證,使用者在看 benchmark 時要記得這一點。
業界即時反應
- Z.ai 創辦人 Tang Jie 在 X 上發文「Frontier intelligence belongs to everyone」,被解讀為對 OpenAI / Anthropic 限縮存取策略的直接回應。
- Hugging Face 模型卡留言區已經有用戶回「This model feels good. I think I will sleep better tonight. Thank you for contributing to open-source.」
- HN 討論串(原文連結)不到 24 小時衝到 320+ 讚,多數留言聚焦在「中國開源模型在第三方 inference 平台上能不能被信任」、「OpenRouter 零資料留存 provider 是不是真的零留存」兩個爭論點。
- TestingCatalog 在 X 報導:「GLM-5.2 scores 46.2% on DeepSWE, the SOTA score among open-weight models」。
對開發者意味著什麼
如果你正在做以下任何一件事,GLM-5.2 值得今天就下載試:
- 寫 coding agent / 終端機 agent:TerminalBench v2.1 +16 是這次最關鍵的進步,代表它能處理「多步驟 + 多檔案 + 需要推理」的程式任務。
- 跑 長上下文科學文件分析:1M context + AA-LCR 71% 讓它能吞下整本教科書、整份財報、整段程式碼 repo。
- 想要 自架(self-host)而不被供應商綁架:MIT 授權 + 8 家 inference provider 雙管齊下,沒有單點故障。
- 預算敏感:官方 API $1.4 / 4.4 per 1M tokens 已經是 frontier 級距的破壞價,比 Claude Opus 5 / GPT-5.5 便宜 10-20 倍。
但如果你追求極致 token 效率、極致 CP 值、極致低幻覺率,DeepSeek V4 Pro max、GLM-5.1、Kimi K2.6 仍然是更平衡的選擇。GLM-5.2 不是「最好」的模型,但它在「open + frontier intelligence」這個交叉點上,目前沒有對手。
參考資料:Artificial Analysis 完整分析 · Z.ai 官網公告 · Hugging Face 模型卡 · HN 討論串 · TestingCatalog 推文
網友熱門留言 (3)