← 返回 Siami 首頁

GLM-5.2 vs Claude Opus 4.8:用一場 WebGL 3D 遊戲定生死的對決

▲ 443
GLM-5.2 vs Claude Opus 4.8:用一場 WebGL 3D 遊戲定生死的對決

編按:本文綜合整理自 TechStackups 對比測試Z.ai 官方模型卡Artificial Analysis 獨立評測Latent Space AINewsGitHub: zai-org/GLM-5Hacker News 討論串,並加入 Siami 編輯部觀點與分析。

事件概要

Z.ai(前身為清華系智譜 AI)於 6 月中旬發布開源旗艦模型 GLM-5.2,並用 1M token 上下文、雙層思考模式(High / Max)與 MIT 授權的開放權重,把目標直接對準 Claude Opus 4.8。TechStackups 的編輯 James Daniel Whitford 沒有只看跑分表,而是給兩個模型丟同一個提示詞:「用純 WebGL,從零寫一個 3D 平台跳躍遊戲,不准用任何引擎或 3D 函式庫。」結果是 Opus 用 33 分鐘做出能玩的版本,GLM-5.2 用 1 小時 10 分做出「能跑、但有 bug」的版本——帳單金額 5.39 美元對 21.92 美元。

這場對決同時被 VentureBeat、Latent Space、Digital Applied、Nick Saraev 等媒體轉述,6 月 22 日登上 Hacker News 後再掀一波討論,普遍共識是:GLM-5.2 是目前最強的開放權重編碼模型,但還沒有追上 Opus 的「品味」與多模態驗證能力。


測試設定:兩模型在同一個擂台上對打

TechStackups 給兩個模型同一份「一次性的」任務:用 raw WebGL(不依賴 Three.js 或任何引擎)寫出一個可運行的 3D 平台跳躍遊戲,包含 GLB 模型解析、矩陣與向量數學、GLSL 皮膚動畫、substep AABB 碰撞、跟隨相機與鍵盤控制。3D 模型是 Kenney 的 CC0 角色套件,兩個模型收到完全相同的素材、相同提示詞,只能跑一次,不能中場提示

量尺GLM-5.2(Pi/OpenRouter)Opus 4.8(Claude Code)
實際建構時間1 小時 10 分 40 秒33 分 30 秒
輸出 token131,000216,809
峰值 context 使用率1M context 的 16%1M context 的 19%
工具呼叫次數128153
帳單金額5.39 美元(實際計費)約 21.92 美元(牌價估算)

Opus 在時間、輸出品質、自檢視覺的能力上都領先;GLM-5.2 則以約 1/4 的價格取得「堪用但粗獷」的成果。帳面數字的差異,幾乎直接映射到下面兩個模型的 bug 嚴重度。


兩支遊戲的 bug 比對:基本面錯誤 vs 邊緣情境

GLM-5.2:基本盤就破了

GLM-5.2 做出來的遊戲「能跑、能動」,但有四個明顯的視覺/邏輯問題:

  • 角色面朝錯誤方向:走動方向正確,但模型整個反轉。
  • 缺貼圖、頭會消失:角色渲染成平面的灰色塊,Kenney 模型共享的色票檔沒有被載入,Opus 載到了,所以角色是有貼圖的。
  • 死亡尖刺不致命:角色直接踩上去,什麼事都沒發生,沒有 reset。
  • 沒有過關條件:碰到旗子也不會贏。

更關鍵的是,GLM-5.2 是純文字模型、無法看圖,它的 self-check 是這樣做的:「打開 final_start/overview/flag.png,分析顏色:草綠、土棕、金幣金、旗子紅、角色偏藍色、半 Lambert 著色、沒有黑色。」從顏色樣本看起來一切正常,它就結案了——但實際畫面上角色還是灰色、debug overlay 還掛在場景上。

Opus:剩下的都是 polish 問題

Opus 的 bug 比較細緻、屬於邊緣情境:

  • 角色能在薄空氣上站著:因為 coyote-time(離開邊緣後還能跳的寬限期)被調得稍微寬鬆了一點。
  • 離旗子還很遠就過關:勝出觸發距離太寬鬆。

這兩個都是「多給了一點點」的調整問題,不是「壓根沒做」的結構問題。Opus 因為能看截圖,自己發現畫面上還留著 debug readouts,主動清掉再結案——這正是 GLM-5.2 缺少的環節。


為什麼這件事重要

GLM-5.2 在這場頭對頭測試裡不是「贏了」,但它把開放權重模型的可商用距離再往前推了一大步

  • MIT 授權的 753B MoE:Hugging Face 與 ModelScope 同步上架,無地區限制,可以下載後用 vLLM、SGLang 或 Transformers 自架。對在意資料落地、成本可控、避免被供應商「說斷就斷」(Fable 5 在 6 月 13 日被下架就是最近的警示)的團隊來說,這是 Anthropic 與 OpenAI 都給不了一條路。
  • 價格對齊 Opus 的 1/4 到 1/5:輸出 token 1M 只要 4.4 美元,Opus 是 25 美元。Z.ai 自己的定位是介於 Opus 4.7 與 4.8 之間,但成本結構完全不同。
  • 雙層思考模式(High / Max)與 131k 輸出:能把整個 monorepo 放進 context,是 agentic 編碼的核心需求。
  • 社區訊號強:Artificial Analysis 把 GLM-5.2 放上 Intelligence Index v4.1 開放權重榜首(51 分),領先 MiniMax-M3 與 DeepSeek V4 Pro;Arena 的 Code Arena Frontend 上排到第 2 名,僅次於 Fable 5。

從開發者工具的選項來看,這是過去半年「開放模型真的能拿來做 agent」最清楚的一次證明。


數據解讀:跑分表告訴了我們什麼

Z.ai 公開的 GLM-5.2 模型卡顯示,在主流編碼與 agentic 基準上,這隻模型與 Opus 4.8 互有領先:

基準GLM-5.2Opus 4.8GPT-5.5Gemini 3.1 Pro
SWE-bench Pro62.169.258.654.2
NL2Repo48.969.750.733.4
Terminal-Bench 2.1(Terminus-2)81.0858474
Terminal-Bench 2.1(最佳 harness)82.778.983.470.7
SWE-Marathon13.026.012.04.0
MCP-Atlas(公開)76.877.875.369.2
Tool-Decathlon48.259.955.648.8

兩個關鍵數字值得單獨講:

  • Terminal-Bench(terminal 操作類任務):GLM-5.2 在最佳 harness 下達到 82.7,是首個突破 80% 的開放權重模型——這個基準跟「工程師實際操作一台機器解決問題」高度相關,會直接影響日常 agent 體驗。
  • SWE-Marathon(超長時工程任務):Opus 26.0 vs GLM-5.2 13.0,差距仍然明顯。這是「跑幾小時、跨檔案、跨工具」的綜合壓力測試,目前還是閉源模型的優勢區。

質疑一:「Open vs Closed」差距不是兩週,而是兩個月——LocalLLaMA 上有使用者實測後指出,GLM-5.2 在「直覺」(哪些該問、哪些不該問、哪些事先要對齊)這個維度上,還是有結構性的差距,這個不是靠 token 預算能直接補上的。

質疑二:Token 飢渴——Artificial Analysis 統計 GLM-5.2 每任務輸出約 43k token,多數是推理過程,是目前主流開放權重模型裡最高的。便宜歸便宜,實際消耗會比牌價預估再高一些。

質疑三:多模態缺口——TechStackups 已經驗證:能看自己截圖的模型,在視覺任務上會拿到結構性的領先。這是 GLM 系列下一個要補的洞。


業界反應:從看好到保留的聲音都有

  • Simon Willison(長期報導每一個值得注意的模型發布):稱 GLM-5.2 為「很可能是史上最強的純文字開放權重 LLM」,他的鵜鶘 SVG 測試拿到完整可動畫版本。
  • Artificial Analysis:Intelligence Index 上把 GLM-5.2 列為開放權重榜首,同時把它放在「成本 vs 智能」前沿的最便宜點。
  • Nathan Lambert(Allen AI):從 LMArena 排名看,他主張「你可以說 Z.ai 在 agent 上比 Gemini 更強」,這對 MIT 開源模型是嚴肅的成就;但他也提醒中國實驗室是用少得多的算力達到這些分數,不應被低估。
  • Hacker News 主流意見:開源派普遍樂觀,但也有資深開發者提醒「很多 HN 上的 GLM 5.2 好評是來自本來就傾向開源的人」,建議實際跑過自己工作流再下結論。

Siami 觀點:怎麼把 GLM-5.2 放進你的工具鏈

對一般工程團隊,這場實測最務實的讀法不是「換掉 Opus」,而是把 GLM-5.2 當成不同任務的工具

  • 純文字、低風險、想省錢:GLM-5.2 直接用 Z.ai Coding Plan 或 OpenRouter 跑,比 Opus 便宜四倍,行為品質對得起它的價格。
  • 需要視覺判斷、要交付乾淨的成品:保留 Opus——它的多模態 self-check 是這次實測裡最大的差異化優勢,bug 更少、迭代更穩。
  • 在意供應商鎖定、想下載權重自架:GLM-5.2 的 MIT 授權與 Hugging Face 上架,讓它成為少數能真正「說帶走就帶走」的前段班模型。
  • 在意單次任務 token 消耗:要把 GLM-5.2 的成本估算抓上 20-30% buffer,再決定要不要全量替換 Opus。

這場 WebGL 對決最重要的訊號不是「誰贏」,而是 「開源模型已經能交付可執行的程式碼、能通過編碼基準、能上架給企業用」這件事,在 2026 年 6 月已經成立——剩下的差距是品味、視覺驗證、長時 agent 穩定性,這些差距正在以月為單位縮小,而不是年。


附錄:兩場實測的可玩版本與原始碼

網友熱門留言 (5)

#1 Hacker News 用戶 ▲ 247
我們熱愛開源模型。GLM 5.2 最近發布了,按幾個主流量尺看,閉源模型與開源模型的差距,已經縮短到大約兩週的時間。
#2 Jeremy Howard ▲ 138
在我自己的用途上,GLM-5.2 至少跟 Opus 4.8 與 GPT 5.5 一樣好——它最大的明顯短板是還沒有視覺模態。
#3 Simon Willison ▲ 96
很可能是有史以來最強的純文字開放權重 LLM。我給它出 SVG 騎腳踏車的鵜鶘題目,它交出一個完全可運作的動畫版本,沒有任何破圖。
#4 Nathan Lambert ▲ 71
從 LMArena 排名看,你甚至可以說它在 agent 方面已經贏過 Gemini。這對一個 MIT 授權的開源模型來說,是非常認真的成就。
#5 LocalLLaMA 用戶 ▲ 58
GLM-5.2 在編程能力上確實已經站在最前緣,逼近兩個月前最好的閉源模型;但在『直覺』這塊(哪些該問、哪些不要),它的表現讓我希望開源還是有很長的路要走。