事件概要
Anthropic 於 2026 年 9 月 29 日發布最新研究報告,正式點名中國 AI 公司智譜(Z.ai)的 GLM-5.3 模型已具備「自主建構端到端網路攻擊利用鏈」的能力,且這款模型在發布時幾乎沒有任何有意義的安全防護限制。
報告明確指出:在 Anthropic 的模擬測試中,攻擊者可以用簡單的手法在 64% 到 100% 的機率下繞過 GLM-5.3 的內建防護。相比之下,Anthropic 自家 Claude 模型在同等測試下完全沒有被突破。這份報告連同美國 NIST 的 CAISI 中心獨立評估結論一同發布,CAISI 直接稱 GLM-5.3 為「至今最強的開源權重模型」,並指出它比美國前沿模型僅落後約四個月。
GLM-5.3 到底能做什麼
Anthropic Frontier Red Team 對 GLM-5.3 進行了一系列自動化與人工協作的評估,聚焦在真實軟體漏洞的「開發完整攻擊利用鏈」這項能力:
- ExploitBench 測試(針對 Google Chrome V8 引擎的已知漏洞):GLM-5.3 在 410 次嘗試中成功開發出 50 次可運作的端到端 exploit;作為對照,Anthropic 內部受限模型 Claude Mythos Preview 在同樣條件下為 56 次。
- 內部 Binary Exploitation 基準(OSS-Fuzz 開源專案的隨機 100 個任務):GLM-5.3 在 4% 的試驗中完成完整控制流劫持(control-flow hijack),Claude Mythos Preview 為 6%,而 GLM-5.2 與 Claude Opus 4.6 都完全無法達成。
- 內部評估推算:有能力的研究團隊若要對這個模型做完整測試,從零開始大概需要 600 GPU 小時、1200 美元成本。
報告特別強調,GLM-5.3 跟前一代 GLM-5.2 之間出現了「質的躍進」,這個跳躍幅度幾乎等同於 Claude Opus 4.6 到 Claude Mythos Preview 之間的差距。
為什麼這件事重要
這份報告的核心訊息不只是「GLM-5.3 變強了」,而是一個更尖銳的結構性問題:當開源權重模型在攻防能力上追上美國前沿模型 4 個月,而前者不需要通過任何安全審查、無使用對象限制時,整個產業的威脅模型就被改寫了。
Anthropic 在報告中直言:「這些能力很可能被國家級與非國家級攻擊者用於真實世界的傷害。」但同時,他們也承認:「這個等級的能力同樣能讓防守方使用。」這不是科幻——Anthropic 自家 Project Glasswing 計畫已透過受信任的 cyber defender 找到超過 1 萬個關鍵軟體漏洞。
更值得關注的是時機。GLM-5.3 在 8 月 14 日就已開放下載(連 FLash 變體都是 MIT 授權),到 9 月下旬 Anthropic 才發出這份「安全警告」。這 6 週的空窗期,任何人都能下載這個模型、繞過防護、開始練習 exploit 開發。Anthropic 自己點出 GLM-5.3 的「防護可被 64% 到 100% 機率繞過」,等於公開承認這個模型已經無法靠防護機制保護社會。
編按:本文綜合整理自 Anthropic 官方研究報告、Anthropic 9 月威脅情報、Reuters 報導、CEO.com 分析、Semgrep 評測、Z.ai 官方博客,並加入 Siami 編輯部觀點與分析。
數據解讀與質疑
1. 為什麼是 64% 到 100%? 這個範圍來自 Anthropic 對不同任務的測試結果——簡單的 prompt injection 任務幾乎 100% 成功(防護等同虛設),但需要較多模型腳步的 malware 開發任務則約 64%。換句話說,最容易、影響最大的攻擊場景,反而最容易被 GLM-5.3 配合。這個區間不是「偶爾成功」,是「常態成功」。
2. 為什麼跟美國前沿模型只差四個月? CAISI 的基準測試同時比較了 GLM-5.3 與美國模型(包括 Claude Opus 4.6 與 Mythos Preview),但美國模型在測試時是被關閉 AI 防護的版本,這些版本僅提供給通過審核的使用者。換句話說,CAISI 的「差距」是「美國前沿能力 vs 全球開放能力」的差距,而真正可被一般攻擊者取得的美國版本,其防護是有效的。這個測試設計本身就承認:目前的「護城河」不是模型能力,而是存取控制。
3. 一份報告,同時是警告與廣告。 Reddit r/LocalLLaMA 與 r/ZaiGLM 上的討論串累積了 1.6K upvotes、超過 370 則留言,最熱門的標題就是:「Anthropic 剛剛幫 GLM 打了史上最棒的廣告」。這個現象值得本週企業對任何「AI 風險報告」都要保持警覺——當一份報告的內容是「X 模型已經追上 Y 四個月」,但 X 又是開源可下載的,那這份報告客觀上就在擴大 X 的能見度。Anthropic 是真心警告,還是順勢做了一次品牌曝光?這個時間點剛好卡在 Anthropic 預備 IPO 的前夕。
4. 監管套利還是公共安全? Hacker News 上有使用者指出 Anthropic 自己的安全防護在某種意義上也是「攻擊者的阻力」——他親身經歷在惡意軟體攻擊緊急時刻 Claude 直接拒絕協助(理由:「超出範圍」),最後是用 DeepSeek v4 Flash 才完成逆向工程。這類案例累積起來,會讓「該不該對開源權重模型設限」這個問題變得極度兩極——支持者說是「監管套利」,反對者說是「公共安全」。
為什麼 Anthropic 自己也在做相同的事
報告最後一段看似呼籲各國政府對高能力 AI 模型進行安全測試,但 Anthropic 自家的 Project Glasswing、Claude Mythos 5.1 受信任存取計畫,本質上也是同一件事:透過存取控制來代替技術防護。這個雙重標準是 AI 安全辯論的核心問題——閉源模型的安全是靠「取得不易」,開源模型的安全是靠「取得後的防護」。當開源模型的防護被 64-100% 繞過時,整個「前端安全」模型就失效了。
Anthropic 在結論中呼籲「各國政府應對足夠強大的 AI 模型進行安全測試」,這個呼籲如果變成政策,最直接的結果可能是:對所有超過某個能力閾值的開源權重模型,要求在釋出前通過第三方評估。這對 Z.ai 這種中國公司會是結構性的成本,但對 Anthropic、OpenAI 這種閉源前沿模型反而影響有限。這是巧合,還是政策設計的本意?
接下來值得追蹤
- NIST CAISI 10 月發布的 GLM-5.3 完整評估報告(會比目前釋出的預覽版更完整)
- 美國國土安全部是否將 GLM-5.3 列入出口管制實體清單
- 歐盟 AI 辦公室是否啟動對開源權重模型的「通用 AI 模型行為準則」調查
- GLM-5.3 在 Hugging Face 的下載量與衍生微調模型(已經出現
dealignai/GLM-5.3-CYBERSECURITY-FP8這類移除防護的版本)
參考來源
| 來源 | 內容 |
|---|---|
| Anthropic 官方研究報告 | GLM-5.3 exploit 能力與防護評估原始數據 |
| Anthropic 9 月威脅情報 | 智譜針對美國 frontier 模型的 distillation 攻擊記錄 |
| Reuters:Z.ai 模型接近 Mythos 5 | 主流外媒 8 月發布時的原始報導 |
| Reuters:Z.ai 關閉 AI 編碼助理 | 安全問題後的處置動作 |
| CEO.com 分析 | 美中 AI 競賽角度的綜合評論 |
| Semgrep 評測 | GLM-5.3 在真實資安工作流的成本效益 |
| Z.ai 官方博客 | 模型發布方的原始 benchmark 與設計目標 |
| Hacker News 討論 | 132 score、98 則評論的社群迴響 |
| Reddit r/LocalLLaMA 討論 | 1.6K upvotes 的「Anthropic 是 GLM 最棒廣告」討論 |
網友熱門留言 (5)