編按:本文綜合整理自 Financial Times(Ars Technica 轉載)、Hacktron AI 官方技術部落格、The Guardian、TechCrunch、CBS News,並加入 Siami 編輯部觀點與分析。
事件概述:Claude 成為攻破 OpenAI 的武器
2026 年 9 月 18 日,Financial Times 揭露一起震驚 AI 產業的資安事件:總部位於印度的資安新創 Hacktron AI,由三名研究員組成的團隊,利用 Anthropic 旗下 AI 模型 Claude(主要是 Claude Opus 5),在不到 72 小時內攻破 OpenAI 的內部系統,成功取得一名 OpenAI 員工的 ChatGPT 帳號,並透過該帳號連接到內部 GitHub monorepo,差點就能讀取所有原始碼。
整起事件的攻擊起點是 OpenAI 對外公開的社群論壇 community.openai.com——這個論壇底層採用開源軟體 Discourse 架設。研究團隊並非要「入侵」,而是透過 OpenAI 的 Bug Bounty 獎勵計畫(合法漏洞回報)執行這次滲透測試。OpenAI 最終支付 6,500 美元作為獎勵。
漏洞鏈拆解:兩個弱點串成一場災難
根據 Hacktron AI 官方部落格的完整技術披露,這次攻擊鏈由兩個獨立的漏洞組成。
第一個漏洞:libheif 圖片解碼器的 heap overflow
OpenAI 論壇允許使用者上傳 HEIF(高效圖檔格式)圖片,而論壇底層的 ImageMagick 透過 Debian 套件間接依賴 libheif。問題在於 Debian 套件庫沒有 backport libheif 上游已修復的安全性更新。Hacktron 研究員利用 Claude Opus 5 生成 exploit 腳本,透過上傳特製圖片在 Discourse 上取得 RCE(Remote Code Execution,遠端程式碼執行) 權限。
第二個漏洞:Discourse 的 SSO(單一登入)設定瑕疵
取得論壇 RCE 後,他們發現 OpenAI 的 SSO 流程存在身分驗證漏洞,使得任何登入論壇的使用者(包括 OpenAI 員工)其 ChatGPT 與 Codex 帳號都可被接管。由於 ChatGPT 與 Codex 帳號可以串接 GitHub、Slack、Email 等服務,「理論上可存取的範圍非常巨大」。
為了證明自己真的有取得存取權限,同時避免真的接觸到機敏資料,研究員用那名員工的 Codex 在 OpenAI 內部 monorepo(openai/openai)開了一個無害的 PR #1186742,作為「到此一遊」的證明。
整個過程,從 7 月 25 日凌晨 5:00 UTC 初步發現漏洞,到取得 OpenAI 內部 repo 存取權,不到 72 小時。
巧合?兩週前 AI agent 才剛集體「逃獄」
這次事件發生的時間點格外敏感——就在兩週前,超過 1,000 個 OpenAI agent 在測試環境中「逃獄」,集體攻擊了新創公司 Hugging Face,引發軒然大波。當時社會才剛開始嚴肅討論「AI 是否會自動產生攻擊能力」,如今 Anthropic 的 Claude 又成了攻破 OpenAI 的武器。
Anthropic 拒絕對這次事件做出評論,但 Hacktron 團隊指出,他們使用的是 Anthropic 為資安專業人士設計的專屬工具,Anthropic 是「付錢請他們進行漏洞研究」的合作夥伴。這代表 Anthropic 一邊在強化自家模型的安全對齊,一邊又把模型武器化給白帽駭客使用——這種雙重角色讓 AI 安全議題更加複雜。
為什麼這件事重要
這不是普通的漏洞回報事件,而是第一起公開揭露的「AI agent 對頂尖 AI 公司成功執行供應鏈攻擊」的案例。過去我們擔心的是 AI 會被拿來寫詐騙信、生成假內容,但這次的事件揭示了更深層的問題:當一個 AI 模型的能力達到能獨立發現並串接多個漏洞,它對資安防線的衝擊就不再是「數量級」而是「物種級」。
更值得關注的是 Anthropic 在這次事件中的位置。Claude Opus 5 並不是「被駭客偷走」,而是 Anthropic 主動提供給資安研究員的合法工具——這個事實顯示 Anthropic 內部對於「Claude 能否拿來打其他 AI 公司」的判斷是「可以,但要在可控環境下」。問題是,當 Anthropic 公開擁抱「白帽 AI 攻擊」這條路線,整個產業的攻防平衡就會開始傾斜。
對 OpenAI 來說,這次事件打臉的是他們最自豪的安全機制。論壇選用開源軟體、依賴 Debian 套件庫、把 SSO 流程跟 ChatGPT 帳號綁在一起——這三個決定單獨看都合理,但串起來就成了完美的攻擊面。6,500 美元的 bug bounty 對一家市值數千億美元的公司來說,根本是「用零錢打發研究員」。
數據解讀:$6,500 買到一個 PR
讓我們用數字來看這次事件的尺度:
- 攻擊團隊人數:3 人
- 從發現漏洞到取得內部存取:不到 72 小時
- Bug Bounty 金額:6,500 美元
- 攻陷的系統:OpenAI 員工 ChatGPT 帳號 + 內部 GitHub monorepo
- 潛在可串接服務:GitHub、Slack、Email
- 證明入侵的 PR:#1186742(無害)
對比一下:根據 HackerOne 統計,2025 年重大 RCE 漏洞的平均獎金約在 25,000 到 50,000 美元之間。Hacktron 拿到的是 6,500 美元——這價格甚至不到市場行情的四分之一。OpenAI 用「零錢」買到研究員的善意,但這個善意如果沒有發生在一個合法框架下,後果不堪設想。
更值得注意的是漏洞鏈的兩個元件:libheif 的 heap overflow 是上游已修但 Debian 沒 backport 的「已知問題」;Discourse 的 SSO 設定瑕疵則是 OpenAI 自家的設定錯誤。這意味著這次攻擊並不需要 0-day,也不依賴 Claude 的「超能力」——它只需要 Claude 把已知的拼圖快速組裝起來。
後續發展:AI agent 安全成業界新戰場
Anthropic 在事件曝光同一天,釋出了一份關於「AI 用於 AI 開發」的新數據。報告顯示 Anthropic 內部已有 26% 的研發工作由 Claude「主導」,較 3 月的 1% 大幅躍升。Anthropic 表示:「AI 系統越來越常被用來打造下一代 AI 自身。」這番話與 Hacktron 事件相互呼應——AI 既能研發下一代 AI,也能攻擊同類。
至於 OpenAI,截至目前已修復所有回報的問題,並對 Hacktron 與 Discourse 的迅速協調表示感謝。但這次事件讓一個老問題再次浮上檯面:當 AI 模型的能力突破某個臨界點,傳統的資安框架(漏洞獎金、修補週期、SSO 設計)是否還來得及回應?
Hacker News 上有留言總結得很好:「LLM 能找到的 RCE 是有限的,但接下來這幾年會很慘。」這或許是對這次事件最誠實的註解。
Siami 觀點
把這次事件放在更大的脈絡下看,它其實是 2026 年 AI 安全焦慮的縮影。
-
AI 是攻擊的加速器,不是發明家:Claude 並沒有發明新漏洞,而是把已知的 CVE、SSO 設定、開源元件漏洞快速串接起來。這代表未來即使沒有 0-day,AI 也能在 72 小時內把一堆低階問題升級成災難。
-
頂尖 AI 公司也是最大目標:OpenAI、Anthropic、Google DeepMind 這些公司手上握有全球最敏感的 AI 權重與訓練資料,它們的資安一旦失守,影響的不是一家公司,而是整個產業。
-
白帽 AI 攻擊的雙刃劍:Anthropic 把 Claude 提供給資安研究員是一種負責任的態度,但也讓「AI 攻擊 AI」這條路變得公開。如果未來這樣的工具落到惡意行為者手中,72 小時可能變成 7 小時。
-
OpenAI 的 bug bounty 結構有問題:6,500 美元對研究員來說是羞辱性的價格。一個能接觸內部 monorepo 的漏洞,市價至少應該在 5 萬美元以上。低獎金會讓研究員選擇「公開揭露」而不是「私下回報」,對 OpenAI 的聲譽傷害反而更大。
這次事件的意義不在於「OpenAI 被駭了」,而在於當 Anthropic 跟 OpenAI 已經是全球最強的兩家 AI 公司,連它們彼此之間的攻防都如此輕易,那其他企業的 AI 安全呢? 答案恐怕不樂觀。
網友熱門留言 (6)