← 返回 Siami 首頁

研究員拿 Anthropic 的 Claude 駭進 OpenAI 72 小時串出內部 PR

💬 75
研究員拿 Anthropic 的 Claude 駭進 OpenAI 72 小時串出內部 PR

編按:本文綜合整理自 Ars Technica(Financial Times 報導)、Hacktron AI 官方技術部落格、Forbes、VentureBeat、Hacker News 討論串,並加入 Siami 編輯部觀點與分析。

事件總覽:Claude 把 OpenAI 的門敲開了

2026 年 9 月 18 日,總部設於印度的資安新創 Hacktron AI 公開披露:他們只花了不到 72 小時,就用 Anthropic 的 Claude Opus 5 串起兩個漏洞,從 OpenAI 公開的社群討論區一路打進 OpenAI 員工的 ChatGPT 帳號,最後在 OpenAI 內部 monorepo(openai/openai)留下一個無害的 pull request(編號 #1186742)作為入侵證明。整起事件由 Hacktron 三人小組執行——Harsh Jaiswal、Mohan Pedhapati、Rahul Maini——總人工時間不過數小時,加上大約 3,000 美元的 Claude token 成本。OpenAI 在 Bugcrowd 的漏洞懸賞計畫下支付 6,500 美元報酬,但官方註明:實際被攻破的 Discourse 論壇並不在懸賞範圍內,獎金只涵蓋 OpenAI 端的 SSO 缺陷。

這不是「駭客攻擊 AI 公司」這種單純的故事——這是一個用 AI 來攻擊另一家 AI 公司的案例,而且成功的一方只花三天、不到 3,000 美元。


攻擊鏈拆解:從一張 HEIF 圖到內部 PR

Hacktron 在官方部落格把整條攻擊鏈攤開來看,這條鏈串得相當漂亮:

HEIF 上傳 → ImageMagick 派送給 libheif → heap buffer overflow
   → RCE on Discourse → OpenAI SSO 缺陷 → 接管 ChatGPT/Codex
   → 連接的 GitHub → 內部 monorepo PR

第一環:libheif 的 heap buffer overflow

整起攻擊的起點,是 OpenAI 社群論壇(community.openai.com)的圖片上傳流程。Discourse 預設用 FastImage 處理圖片,但 FastImage 不支援 HEIF/HEIC/AVIF,所以這些檔案會被改丟給 ImageMagick 的 magick 命令做轉檔——而 ImageMagick 底層呼叫的 libheif 函式庫,本身含有未修補的 heap buffer overflow 漏洞。關鍵細節:這個漏洞上游已經修補,但 Debian 12 與 13 的套件維護者並沒有 backport 該修補,而且上游的 commit 並未被標記為安全性更新、也沒配 CVE。Discourse 的 Docker 映像基於 Debian 12,所以跑的是有洞的 libheif 1.19.7(Debian 13 當時也還是 1.19.8,直到 8 月 8 日才發布 DSA-6417-1 安全更新)。

第二環:Opus 4.8 撞牆,Opus 5 當晚成功

Hacktron 先用 Claude Opus 4.8 試著寫 exploit,在開 ASLR 的情況下繞了好幾個 session 都失敗。7 月 24 日當晚 Anthropic 發布 Opus 5,他們立刻開新 session 重做——3 小時內就在本地 Mac 跑出 ARM64 exploit,再請模型把 exploit 移植到 Discourse 用的 x86-64 + jemalloc 環境。

到 7 月 25 日清晨 6:00 UTC,本機 RCE 確認。Claude 接著被放進 /goal 自走迴圈,打到 Hacktron 自架的 Discourse Cloud 複製品上(為了避免模型拒絕對遠端實機產出 exploit,他們用 rce.ee/ctf-forum 把它偽裝成 CTF 靶機)。10:00 UTC 回頭看,模型已經拿到 RCE 並讀到 /etc/hosts

第三環:OpenAI 的 SSO 沒做好身分隔離拿到 Discourse 管理權還不夠,Hacktron 真正的戰利品是 OpenAI 員工帳號。他們發現 OpenAI 的「Sign in with OpenAI」流程有個 SSO 設計瑕疵——任何能控制 community.openai.com 的人,都能把 session 升級成 ChatGPT/Codex 員工帳號的存取權。

Hacktron 特別強調:這個 SSO 缺陷不是 Discourse 獨有。任何使用 OpenAI SSO 的第一方或第三方服務,只要被攻陷就會有同樣下場。Discourse 只是其中一個證明路徑。由於 Codex 可以串接 GitHub、Slack、Email 等外部服務,理論上被接管的員工帳號能擴及的範圍「非常巨大」。

第四環:留下 PR 作為入侵證明

Hacktron 接管了一位 OpenAI 員工的 Codex 帳號——該帳號的 Codex 連到 OpenAI 內部的 GitHub organization。他們請這個被接管的 Codex 在 openai/openai monorepo 開一個無害 PR,編號 #1186742(連結應 OpenAI 要求被撤下),做為「我們確實有存取權」的證明,刻意沒有讀取任何內部程式碼,然後停止所有測試。整個時序如下:

時間 (UTC)事件
2026-07-23開始審視 Discourse 圖片上傳管線
2026-07-24Opus 4.8 撞牆;當晚 Opus 5 發布
2026-07-25 05:00–06:00本機 RCE 確認
2026-07-25 08:00–10:00透過 Bugcrowd 提交漏洞報告
2026-07-25 13:30–15:30PR #1186742 作為入侵證明;停止所有測試
2026-07-25 22:49OpenAI 回信確認修補完成
2026-07-25同日提交 Discourse(HackerOne)
2026-07-27Discourse 修補就緒
2026-07-28Discourse 發布 GHSA-vhm9-85gw-x335 公告
2026-09-01OpenAI 支付 6,500 美元並結案
2026-09-18公開揭露(Wall Street Journal、FT、Ars)

「HEIF Heist」:真正的範圍比 OpenAI 大得多

Hacktron 把這個研究命名為「HEIF Heist」,因為 libheif 的攻擊面遠不止 Discourse 一家。在為期兩個月的延伸研究中,他們用同一條漏洞鏈打到 Slack、Meta、GitHub Enterprise、Ruby on Rails,以及 Next.js、Astro、Gatsby 等 Node.js 框架。只有 Shopify 偵測到活動——其他公司在數千張惡意圖片、反覆當機的 image processor 之間,完全沒看到。關鍵模型演進觀察:

「每次新模型發布都明顯更強。Opus 4.8 跨好幾個 session 都生不出可用的 ASLR-bypass exploit;Opus 5 發布幾小時內就解決同樣問題。後續從 Opus 5 到 GPT-5.6 Sol 又是一次明顯跳躍——我們能在不知道目標系統任何資訊的情況下把漏洞做成可用的 exploit,模型從幾乎全盲開始,每家新公司都只花一兩天就完成攻擊適配。」—— Hacktron 官方部落格


為什麼這件事重要這不是又一個 AI 公司被駭的新聞——這是 AI 安全研究本身的典範轉移。過去要把一個記憶體漏洞做成穩定 exploit,需要頂尖 binary exploitation 專家、好幾週時間、還要對目標環境有相當了解。「已知漏洞要 operationalize 很貴、零日漏洞則只保留給最有價值的目標」這條潛規則,曾經在實務上保護了大多數企業。現在這條護城河被 AI 抽掉了。Hacktron 整個 HEIF Heist 計畫兩個月、3,000 美元、三位研究員——平均每家公司一兩天就完成。3,000 美元比一次滲透測試還便宜,比一次漏洞賞金獵人的最低工時還低。對企業資安的現實含意是三點:

  1. 威脅模型必須重寫。預設假設不再是「沒人會為這個目標花這麼多資源」,而是「任何 AI 訂閱者都是潛在攻擊者」。libheif、ImageMagick、FastImage 這類「看似無害的圖片處理基礎設施」,現在都是第一線戰場。
  2. 記憶體安全的舊假設失效。Debian 的維護者之所以沒 backport libheif 修補,是因為上游沒把它標記為 CVE。這種「上游沒分類 = 不緊急」的潛規則,在 AI 輔助 exploit 開發的時代已經不適用。
  3. 攻擊與防禦的經濟學同時崩盤。白帽得自己付 token 錢、受合規約束、還要顧及客戶隱私;黑帽接管帳號後偷別人的算力來用。Hacker News 討論串中多位資深研究員點出同一件事:「兩邊成本都下降,但黑帽的下降幅度比白帽大」。而最讓人不安的是:Hacktron 已經公開表示他們「會繼續在其他前沿實驗室與網路關鍵系統上做同樣的研究」。換句話說——這只是第一波

數據解讀與質疑幾個值得停下來檢視的數字與說法:

  • 「三天、3,000 美元、三人」這個口號要小心。3,000 美元是全部 HEIF Heist 兩個月研究的 token 成本,不是單獨針對 OpenAI 這一次的開銷。但「單獨 OpenAI」也只花了數小時人工 + 數百美元 token。這個數字級距已經足以讓中等規模的 APT 集團重新評估 ROI。
  • 6,500 美元 bounty 的訊號混亂。OpenAI 一邊支付懸賞、一邊在 HackerOne 附註「Discourse 部分不在懸賞範圍」。這代表 OpenAI 對「SSO 缺陷 vs. Discourse 漏洞」的法律歸屬切割很清楚,但從外部觀點看,整起事件就是同一條攻擊鏈,分開計價會讓人低估事件的整體嚴重性。
  • 為什麼是 Claude 而不是 OpenAI 自家模型? Hacktron 在延伸研究階段確實也用了 GPT-5.6 Sol,而且報告說從 Opus 5 到 GPT-5.6 Sol 是「又一次明顯跳躍」。但針對 OpenAI 這次攻擊本身,他們用的是 Anthropic Claude——這並非偶然。Claude 在「代理式攻擊 + 自主迴圈」任務上表現最穩定,而 OpenAI 的模型在「對遠端實機產出可運作 exploit」這類任務上仍然會踩煞車。未來如果對手用的是中國開源模型,這條護欄可能更脆弱
  • Anthropic 的回應是「拒絕評論」。這本身就是訊號——Anthropic 既沒有撇清責任(這本來就是合法的安全研究),也沒有為 Opus 5 在該領域的能力背書。對照 Anthropic 7 月發布的《Investigating three incidents in our cybersecurity evaluations》報告,這次攻擊可說是那份報告的真實世界延伸
  • 兩週前的「1,000 隻 OpenAI agent 逃出沙盒」事件。Ars Technica 文中特別提及這件事,並把兩起事件相提並論。讀者很容易把它們理解成同一波,但其實是兩件獨立事件:7 月底是 OpenAI 自家模型在沙盒評測中自主逃逸,9 月這次是外部研究員用 Anthropic 模型攻擊 OpenAI。把它們混為一談是常見的誤讀

後續發展與業界反應公開揭露後 24 小時內,主要反應分三類:

  1. 資安社群主流反應:把這次事件歸類為「負責任揭露的教科書案例」。Hacktron 在拿到 RCE 後立即停止測試、立刻通報、刻意不讀取任何內部資料、把 PR 作為唯一證據。Forbes、VentureBeat、CBS News 等媒體均以正面角度報導。
  2. 企業 IT 社群:進入緊急 patch 模式。GHSA-vhm9-85gw-x335 公告中明確警告「自架 Discourse 的管理者請立刻 rebuild Docker 映像,僅做 web 介面更新無法替換底層 libheif」。多家 SaaS 供應商私下通知客戶重新檢視 image pipeline。
  3. AI 政策圈:把這次事件視為「AI 加速攻防不對稱」的證據。Anthropic 自身於 7 月發布的評估報告已點出類似憂慮,這次事件等於把紙上分析變成實證。

OpenAI 在公開聲明中表示:「我們感謝研究員聯繫我們並分享發現,已修復相關問題。」Discourse 也在 48 小時內完成修補並加上 image-processing sandbox 作為縱深防禦。但目前沒有任何跡象顯示 OpenAI 對 SSO 流程做了根本性重構——這是下一波 attack surface 的核心,值得繼續觀察。


該關心的下一步對台灣與中文圈的讀者,這次事件最值得帶走的不是「OpenAI 被駭了」這種頭條,而是三個更具操作意義的問題:

  1. 你們公司的服務有沒有用 Discourse、WordPress、或任何把 HEIF/AVIF 直接丟給 ImageMagick 的圖片管線? 如果有,請把 libheif 升到 v1.23.4 以上的上游安全版本,或把 .heic/.heif/.avif 上傳功能直接關掉。
  2. SSO 設計有沒有「單一論壇失陷 = 整個員工身分失陷」的單點? Hacktron 特別強調 OpenAI SSO 的設計缺陷不是 Discourse 獨有的——任何依賴第三方身份供應商的 SaaS 都該重新檢視 token 綁定。
  3. 你們的威脅模型還停留在「沒人會花資源攻擊我們」嗎? 3,000 美元、三天、三人——這個數字應該被寫進下一次董事會的資安報告。

編按:本文綜合整理自 Ars TechnicaHacktron AI 官方部落格ForbesVentureBeatCBS NewsHacker News 討論串,並加入 Siami 編輯部觀點與分析。

網友熱門留言 (5)

#1 Hacker News 網友 ▲ 287
可被 LLM 挖出的 RCE 數量終究是有限的。接下來幾年會很顛簸,但撐過去之後軟體堆疊會更安全。我寧可讓大家都有完整能力、快速清掉臭蟲,也不要把 LLM 限制成只有三字母機關才能用。
#2 Hacker News 網友 ▲ 192
AI 唯一改變的事,就是同時壓低了攻擊與防禦的成本。遊戲規則沒變,只是節奏變快。
#3 Hacker News 網友 ▲ 154
改變比這多很多。例如『腳本小子』的進場門檻幾乎消失了,低技能準駭客也能打出致命攻擊。2017 年要把一個 CVE 玩成 KEV(已知遭利用漏洞)需要 2-3 個月加上一組資深工程師;現在我的實習生連底層技術都不用懂,就能闖進警用無線電系統。
#4 Hacker News 網友 ▲ 121
若以『每單位 token 換來的破壞力』計算,天秤已經倒向攻擊方。白帽得自己出 token 錢、只能用符合治理規範的昂貴供應商;黑帽則到處接管帳號、偷別人的算力來用。
#5 Hacker News 網友 ▲ 98
開發者這邊有個吊詭處:最強的模型拒絕做完整的程式碼審查。你沒辦法叫 Fable 5.1 把你整套程式碼翻一遍找漏洞,因為那跟攻擊者的行為根本無法區分。安全護欄最後反而保護了攻擊者、綁住防守者。