編按:本文綜合整理自 TechStackups 對比測試、Z.ai 官方模型卡、Artificial Analysis 獨立評測、Latent Space AINews、GitHub: zai-org/GLM-5 及 Hacker News 討論串,並加入 Siami 編輯部觀點與分析。
事件概要
Z.ai(前身為清華系智譜 AI)於 6 月中旬發布開源旗艦模型 GLM-5.2,並用 1M token 上下文、雙層思考模式(High / Max)與 MIT 授權的開放權重,把目標直接對準 Claude Opus 4.8。TechStackups 的編輯 James Daniel Whitford 沒有只看跑分表,而是給兩個模型丟同一個提示詞:「用純 WebGL,從零寫一個 3D 平台跳躍遊戲,不准用任何引擎或 3D 函式庫。」結果是 Opus 用 33 分鐘做出能玩的版本,GLM-5.2 用 1 小時 10 分做出「能跑、但有 bug」的版本——帳單金額 5.39 美元對 21.92 美元。
這場對決同時被 VentureBeat、Latent Space、Digital Applied、Nick Saraev 等媒體轉述,6 月 22 日登上 Hacker News 後再掀一波討論,普遍共識是:GLM-5.2 是目前最強的開放權重編碼模型,但還沒有追上 Opus 的「品味」與多模態驗證能力。
測試設定:兩模型在同一個擂台上對打
TechStackups 給兩個模型同一份「一次性的」任務:用 raw WebGL(不依賴 Three.js 或任何引擎)寫出一個可運行的 3D 平台跳躍遊戲,包含 GLB 模型解析、矩陣與向量數學、GLSL 皮膚動畫、substep AABB 碰撞、跟隨相機與鍵盤控制。3D 模型是 Kenney 的 CC0 角色套件,兩個模型收到完全相同的素材、相同提示詞,只能跑一次,不能中場提示。
| 量尺 | GLM-5.2(Pi/OpenRouter) | Opus 4.8(Claude Code) |
|---|---|---|
| 實際建構時間 | 1 小時 10 分 40 秒 | 33 分 30 秒 |
| 輸出 token | 131,000 | 216,809 |
| 峰值 context 使用率 | 1M context 的 16% | 1M context 的 19% |
| 工具呼叫次數 | 128 | 153 |
| 帳單金額 | 5.39 美元(實際計費) | 約 21.92 美元(牌價估算) |
Opus 在時間、輸出品質、自檢視覺的能力上都領先;GLM-5.2 則以約 1/4 的價格取得「堪用但粗獷」的成果。帳面數字的差異,幾乎直接映射到下面兩個模型的 bug 嚴重度。
兩支遊戲的 bug 比對:基本面錯誤 vs 邊緣情境
GLM-5.2:基本盤就破了
GLM-5.2 做出來的遊戲「能跑、能動」,但有四個明顯的視覺/邏輯問題:
- 角色面朝錯誤方向:走動方向正確,但模型整個反轉。
- 缺貼圖、頭會消失:角色渲染成平面的灰色塊,Kenney 模型共享的色票檔沒有被載入,Opus 載到了,所以角色是有貼圖的。
- 死亡尖刺不致命:角色直接踩上去,什麼事都沒發生,沒有 reset。
- 沒有過關條件:碰到旗子也不會贏。
更關鍵的是,GLM-5.2 是純文字模型、無法看圖,它的 self-check 是這樣做的:「打開 final_start/overview/flag.png,分析顏色:草綠、土棕、金幣金、旗子紅、角色偏藍色、半 Lambert 著色、沒有黑色。」從顏色樣本看起來一切正常,它就結案了——但實際畫面上角色還是灰色、debug overlay 還掛在場景上。
Opus:剩下的都是 polish 問題
Opus 的 bug 比較細緻、屬於邊緣情境:
- 角色能在薄空氣上站著:因為 coyote-time(離開邊緣後還能跳的寬限期)被調得稍微寬鬆了一點。
- 離旗子還很遠就過關:勝出觸發距離太寬鬆。
這兩個都是「多給了一點點」的調整問題,不是「壓根沒做」的結構問題。Opus 因為能看截圖,自己發現畫面上還留著 debug readouts,主動清掉再結案——這正是 GLM-5.2 缺少的環節。
為什麼這件事重要
GLM-5.2 在這場頭對頭測試裡不是「贏了」,但它把開放權重模型的可商用距離再往前推了一大步:
- MIT 授權的 753B MoE:Hugging Face 與 ModelScope 同步上架,無地區限制,可以下載後用 vLLM、SGLang 或 Transformers 自架。對在意資料落地、成本可控、避免被供應商「說斷就斷」(Fable 5 在 6 月 13 日被下架就是最近的警示)的團隊來說,這是 Anthropic 與 OpenAI 都給不了一條路。
- 價格對齊 Opus 的 1/4 到 1/5:輸出 token 1M 只要 4.4 美元,Opus 是 25 美元。Z.ai 自己的定位是介於 Opus 4.7 與 4.8 之間,但成本結構完全不同。
- 雙層思考模式(High / Max)與 131k 輸出:能把整個 monorepo 放進 context,是 agentic 編碼的核心需求。
- 社區訊號強:Artificial Analysis 把 GLM-5.2 放上 Intelligence Index v4.1 開放權重榜首(51 分),領先 MiniMax-M3 與 DeepSeek V4 Pro;Arena 的 Code Arena Frontend 上排到第 2 名,僅次於 Fable 5。
從開發者工具的選項來看,這是過去半年「開放模型真的能拿來做 agent」最清楚的一次證明。
數據解讀:跑分表告訴了我們什麼
Z.ai 公開的 GLM-5.2 模型卡顯示,在主流編碼與 agentic 基準上,這隻模型與 Opus 4.8 互有領先:
| 基準 | GLM-5.2 | Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| SWE-bench Pro | 62.1 | 69.2 | 58.6 | 54.2 |
| NL2Repo | 48.9 | 69.7 | 50.7 | 33.4 |
| Terminal-Bench 2.1(Terminus-2) | 81.0 | 85 | 84 | 74 |
| Terminal-Bench 2.1(最佳 harness) | 82.7 | 78.9 | 83.4 | 70.7 |
| SWE-Marathon | 13.0 | 26.0 | 12.0 | 4.0 |
| MCP-Atlas(公開) | 76.8 | 77.8 | 75.3 | 69.2 |
| Tool-Decathlon | 48.2 | 59.9 | 55.6 | 48.8 |
兩個關鍵數字值得單獨講:
- Terminal-Bench(terminal 操作類任務):GLM-5.2 在最佳 harness 下達到 82.7,是首個突破 80% 的開放權重模型——這個基準跟「工程師實際操作一台機器解決問題」高度相關,會直接影響日常 agent 體驗。
- SWE-Marathon(超長時工程任務):Opus 26.0 vs GLM-5.2 13.0,差距仍然明顯。這是「跑幾小時、跨檔案、跨工具」的綜合壓力測試,目前還是閉源模型的優勢區。
質疑一:「Open vs Closed」差距不是兩週,而是兩個月——LocalLLaMA 上有使用者實測後指出,GLM-5.2 在「直覺」(哪些該問、哪些不該問、哪些事先要對齊)這個維度上,還是有結構性的差距,這個不是靠 token 預算能直接補上的。
質疑二:Token 飢渴——Artificial Analysis 統計 GLM-5.2 每任務輸出約 43k token,多數是推理過程,是目前主流開放權重模型裡最高的。便宜歸便宜,實際消耗會比牌價預估再高一些。
質疑三:多模態缺口——TechStackups 已經驗證:能看自己截圖的模型,在視覺任務上會拿到結構性的領先。這是 GLM 系列下一個要補的洞。
業界反應:從看好到保留的聲音都有
- Simon Willison(長期報導每一個值得注意的模型發布):稱 GLM-5.2 為「很可能是史上最強的純文字開放權重 LLM」,他的鵜鶘 SVG 測試拿到完整可動畫版本。
- Artificial Analysis:Intelligence Index 上把 GLM-5.2 列為開放權重榜首,同時把它放在「成本 vs 智能」前沿的最便宜點。
- Nathan Lambert(Allen AI):從 LMArena 排名看,他主張「你可以說 Z.ai 在 agent 上比 Gemini 更強」,這對 MIT 開源模型是嚴肅的成就;但他也提醒中國實驗室是用少得多的算力達到這些分數,不應被低估。
- Hacker News 主流意見:開源派普遍樂觀,但也有資深開發者提醒「很多 HN 上的 GLM 5.2 好評是來自本來就傾向開源的人」,建議實際跑過自己工作流再下結論。
Siami 觀點:怎麼把 GLM-5.2 放進你的工具鏈
對一般工程團隊,這場實測最務實的讀法不是「換掉 Opus」,而是把 GLM-5.2 當成不同任務的工具:
- 純文字、低風險、想省錢:GLM-5.2 直接用 Z.ai Coding Plan 或 OpenRouter 跑,比 Opus 便宜四倍,行為品質對得起它的價格。
- 需要視覺判斷、要交付乾淨的成品:保留 Opus——它的多模態 self-check 是這次實測裡最大的差異化優勢,bug 更少、迭代更穩。
- 在意供應商鎖定、想下載權重自架:GLM-5.2 的 MIT 授權與 Hugging Face 上架,讓它成為少數能真正「說帶走就帶走」的前段班模型。
- 在意單次任務 token 消耗:要把 GLM-5.2 的成本估算抓上 20-30% buffer,再決定要不要全量替換 Opus。
這場 WebGL 對決最重要的訊號不是「誰贏」,而是 「開源模型已經能交付可執行的程式碼、能通過編碼基準、能上架給企業用」這件事,在 2026 年 6 月已經成立——剩下的差距是品味、視覺驗證、長時 agent 穩定性,這些差距正在以月為單位縮小,而不是年。
附錄:兩場實測的可玩版本與原始碼
- GLM-5.2 的遊戲:3dgame-glm.d.ritzademo.com
- Opus 4.8 的遊戲:3dgame-opus.d.ritzademo.com
- 兩者原始碼:github.com/jamesdanielwhitford/glm-5.2-vs-opus-platformers
- Z.ai 模型卡與權重下載:z.ai/blog/glm-5.2 ・ Hugging Face: zai-org/GLM-5
網友熱門留言 (5)