← 返回 Siami 首頁

智譜正式發布 GLM-5.3:程式設計最強開源模型,較 GLM-5.2 提升 50%

▲ 10
智譜正式發布 GLM-5.3:程式設計最強開源模型,較 GLM-5.2 提升 50%

編按:本文綜合整理自 IT之家報導、Z.ai 官方部落格、explainx.ai benchmark 解析,並加入 Siami 編輯部觀點與分析。

智譜(Z.ai)於 2026 年 8 月 14 日正式發布 GLM-5.3,這是一款在 GLM-5.2 基座模型上透過後訓練(post-training)大幅強化的開源模型,主打「程式設計」與「資安防禦」兩大能力。官方宣稱 GLM-5.3 是目前「程式設計能力最強的開源模型」,並在多項公開基準測試取得開源第一的成績。

核心升級:後訓練把同一個基座榨出更高智能

與 GLM-5.2 相比,GLM-5.3 的基座模型完全沒有改變,所有進步都來自後訓練的 scaling。智譜表示,他們把長程任務環境的規模擴大到「數十倍」、種類更加多元,並延長後訓練時間,藉此把基座模型的智能上界向上推了一大步。

這次升級背後用到三項自研技術:

  • IndexShare:用於高效分配強化學習計算資源
  • SAO(含 compaction):讓強化學習策略在長程任務中保持穩定
  • 新一代 Slime 框架:持續演進的 RL 訓練框架

智譜自己承認:「可能智譜還遠未開發出這個基座的智能上界」—— 意思是只要繼續做後訓練,這顆基座還能再榨出更多能力。


程式設計能力:開源最強,但未全面壓過封閉模型

GLM-5.3 在內部自建的 Z.ai Code Bench 體感評測中較 GLM-5.2 提升 50%,在公開基準測試上也取得開源第一。具體數字如下:

基準測試GLM-5.3GLM-5.2領先對手
Terminal-Bench 3.0(終端機環境真實任務)28.34.6Mythos/Fable 5(33.7)、GPT-5.6 Sol(34.6)
DeepSWE v1.1(長程軟體工程)66.946.2Mythos/Fable 5(69.7)、GPT-5.6 Sol(72.7)
Agents’ Last Exam (CLI)(跨工具長程任務)28.523.8GPT-5.6 Sol(28.6)
GDPval-AA v2 Elo(44 種真實職業場景)17691508Mythos/Fable 5(1743)
AutomationBench48.2%26.2%Mythos/Fable 5(46.2%)

特別值得注意的是 Z.ai Code Bench 的 token 效率實測:在 High 檔位下,GLM-5.3 達到 31.4% 準確率,超越 Claude Opus 4.8 最高檔位的 29.5%,但每項任務平均輸出約 5 萬 tokens,而 Opus 4.8 需要約 12 萬 tokens。換言之,GLM-5.3 用更短的執行路�就能完成任務。

但這不代表 GLM-5.3 在所有項目都領先——在 DeepSWE、Terminal-Bench 3.0 與 HLE w/Tools 上,Mythos/Fable 5 與 GPT-5.6 Sol 仍然略勝一籌。智譜的官方說法是「程式設計與 Agent 能力接近 Claude Fable 5」,並未聲稱完全超越。


🚨 為什麼這件事重要

GLM-5.3 之所以值得關注,是因為它代表三條重要趨勢的交會:

  1. 後訓練 scaling 的紅利還沒見頂:同一顆基座模型(與 GLM-5.2 完全相同)只靠後訓練就把多項基準測試從接近 0 拉到開源第一,顯示預訓練不是唯一瓶頸,「RL 環境設計」與「長程任務多樣性」可能比模型參數量更值得投資。

  2. 開源模型的「資安雙用」困境正式浮上檯面:GLM-5.3 在 CyberGym(白盒漏洞發現)拿下 84.5%、超越 Mythos 5 與 GPT-5.6 Sol,但智譜因此延遲釋出權重、連 API 都要先通過安全審查。這是開源社群第一次面對「因為資安能力太強而延後開源」的局面,未來其他強模型(Mythos、Claude Opus 等)若跟進,將重塑整個開源生態的釋出節奏。

  3. 中國 AI 模型的全球開發者採用循環成形:TraeWork、TraeCode、扣子、WorkBuddy、CodeBuddy、Qoder、QwenWork、CatPaw、JoyCode、OpenCode 等十餘家編碼平台在發布當天就開放搶先體驗。GLM-5.3 透過 Anthropic 相容端點「三個環境變數 + 不需要 shim」就能接進 Claude Code、OpenCode 等既有工具——這把「試用成本」壓到 90 秒,是 GLM 系列能在西方開發者圈擴張的關鍵設計。


🚨 數據解讀與質疑

雖然官方數字很漂亮,但有幾個地方值得質疑:

  • 「提升 50%」的基準是內部自建體感評測:Z.ai Code Bench 是智譜自己的產品,方法論未公開、無法獨立驗證。相對之下,Terminal-Bench 3.0 從 4.6 拉到 28.3 雖然驚人,但這個基準的測試環境與其他模型是否完全一致,仍需第三方獨立跑分確認。
  • ExploitBench 仍落後 Mythos 5 與 GPT-5.6 Sol:智譜在 ExploitBench 上拿到 54.4%,Mythos 5 為 78.0%、GPT-5.6 Sol 為 76.5%。在 ExploitGym(時限內能完成的漏洞利用任務數)上,GLM-5.3 兩小時完成 105 個、六小時 130 個;Mythos 5 是 181 / 247—— 攻擊鏈後段的差距「刻意保留」。智譜說這是「防�優先」框架的設計,但這也意味著 GLM-5.3 不能直接當攻擊工具使用。
  • 「開源」其實是分階段釋出:GLM-5.2 在 6 月發布後,權重幾天內就以 MIT 授權登上 Hugging Face;GLM-5.3 卻要等「兩週安全加固」後才開源權重,連 API 也要先通過審查。對想自架的開發者來說,等待時間比 GLM-5.2 週期長很多。
  • 沒有 vision 能力:6 月 29 日 Jie Tang 在 X 上徵詢社群意見時,「視覺理解」是得票最高的訴求(466,000 次瀏覽、3,400+ 則回覆)。但 GLM-5.3 最終發布完全沒提視覺能力,與社群期待落差明顯。

上線時程與可用管道

GLM-5.3 採用「分階段釋出」模式:

  • 即刻上線:智譜官方程式設計工具 ZCode、效率工具 AutoClaw、GLM Coding Plan(全量用戶 + 開放訂閱)、TraeWork / TraeCode / 扣子、WorkBuddy / CodeBuddy、Qoder / QwenWork、CatPaw、JoyCode、OpenCode 等編碼平台
  • 即將上線:API(先通過安全審查)
  • 兩週後開源:完整模型權重(MIT 授權,待安全評估與加固完成後上 Hugging Face)

智譜強調「完整模型權重將在兩週內開源,此前需完成必要的安全加固,盡可能限制其潛在攻擊能力,保留其防禦價值」——這段話明確把模型定位為「資安防禦工具」而非通用攻擊模型。


參考來源

  1. Z.ai 官方部落格:GLM-5.3: Frontier Coding with Emergent Cyber Capabilities
  2. Z.AI Developer Document:GLM-5.3 Overview
  3. explainx.ai:GLM-5.3 Launch — Benchmarks, Pricing & Access
  4. IT之家:智譜正式發布 GLM-5.3
  5. Hacker News:GLM-5.3 frontier coding with emergent cyber capabilities
  6. daily.dev:GLM-5.3 didn’t change the base model — where did its coding gains come from?

相關影片

網友熱門留言 (4)

#1 Z.ai 官方帳號 ▲ 320
Introducing GLM-5.3: Built to Code. Ready for Cyber Defense. — Top-tier coding and agentic capabilities, achieved through post-training on the 743B base model. 推出 12 小時內累積超過 62,500 次瀏覽。
#2 Command Code 開發者 ▲ 187
已經把 GLM 5.3 接到自家 Command Code 上跑了。內部做了一個趣味評測:故意把模型卡在迴圈裡看它會怎樣。之前每個 GLM 版本都只是不斷重複;GLM 5.3 是第一個會主動發現問題、跳出迴圈的版本。
#3 Hacker News 用戶 ▲ 142
與 GLM-5.2 比起來,這次釋出方式很不一樣。GLM-5.2 開源權重幾天就上 Hugging Face,Cline 還因此推出 9.99 美元月費方案;GLM-5.3 走分階段釋出,連 API 都要等安全審查通過才公開。
#4 deep.dev 編輯 ▲ 95
這次進步幾乎全部來自後訓練,基座模型跟 GLM-5.2 完全一樣。長程任務環境規模約擴大十倍、覆蓋更多開發者工具類型。對想升級的開發者來說是好消息,但對想自架開源權重的人要多等幾週。