← 返回 Siami 首頁

漏洞回報不再特殊了:LLM 把資安研究員變凡人,維持者該怎麼辦

▲ 119 💬 49
漏洞回報不再特殊了:LLM 把資安研究員變凡人,維持者該怎麼辦

編按:本文綜合整理自 Filippo Valsorda 個人部落格原文(words.filippo.io/vuln-reports/)、Hacker News 討論串、Bluesky / Lobsters 後續回應,並加入 Siami 編輯部觀點與分析。Filippo 為 Cloudflare 密碼學團隊負責人、前 Google Go 語言 Security team lead,本文是他 2026 年 6 月 23 日發表的一手觀察文。


漏洞報告為什麼以前很「特殊」

Filippo 在原文一開頭就點出一個長年存在於開源社群、資安圈與企業安全團隊之間的默契:漏洞回報跟一般 issue 不一樣

  • 一般 issue:使用者(user)請求 maintainer 提供服務 — 修 bug、加功能、改文件。Maintainer 可以答應、拒絕、拖延,沒有人會覺得不對。
  • 漏洞回報:資安研究員「提供」服務 — 把脆弱點悄悄告訴團隊,讓 maintainer 能在攻擊者發布 exploit 前先修好。換的是 responsiveness(迅速回應)attribution(公開致謝)

這個默契的根基是 maintainer 對使用者安全的責任。安全研究員不特別,特別的是他們帶來的「insight」跟「confidentiality」:保密讓 patch 能先發,曝光讓 exploit 不會先發。

但 Filippo 用一個簡單的時間標籤就把這個故事的根基砍掉:「It’s 2026 and none of the premises are true anymore.(2026 年了,這些前提都不成立了。)」


三個前提為什麼失靈

1️⃣ Insight 不再稀缺

過去,找到一個有真實影響的 CVE 需要:

  • 對目標程式語言、執行環境、依賴鏈有深厚 domain expertise
  • 能 reverse engineer 二進位、讀 machine code、拆 protocol
  • 花數天到數週手動 fuzz 跟審閱

2026 年的現實:LLM 的程式碼理解能力已經到了「接近任何一位資安研究員」的程度。Maintainer 可以跑、攻擊者可以跑、研究員也可以跑。三方在同一個起跑線

Filippo 直接寫:「The insight is not scarce and precious anymore.(洞見不再稀缺珍貴了。)」

瓶頸從「能不能找到洞」變成「這個洞是不是真的」— 也就是 triage

2️⃣ Triage 也沒比較容易

當任何人都能讓 LLM 跑過一萬行 code、產出 50 個「候選漏洞」,真正的瓶頸反而是驗證。這時外部研究員其實幫不上忙(除非你已經跟他有 trust 關係):他們丟進來的可能就是 LLM 的產出,跟你 security@ 收件匣裡另一份 LLM 產出的信號雜訊比差不多。

Filippo 的原話:「picking through an LLM’s output or through a security@ inbox has approximately the same signal-to-noise ratio(從 LLM 輸出挑漏洞,跟從 security@ 收件匣挑,訊噪比差不多。)」

3️⃣ 機密協調也失效

過去的 embargo 模型假設:研究員守住秘密 → vendor 修補 → 雙方約定時間公開揭露。LLM 改變了這個遊戲。攻擊者不需要等你的 full disclosure post — 他們可以請自己的 LLM 跑同一段 code、生成 exploit,自己內部消化掉。

雙方現在有同一個 triage 瓶頸:攻擊者也要花時間判斷「這 50 個候選漏洞裡哪個值得武器化」。換言之,window of opportunity 從「攻擊者早於 defender 知道」變成「誰 triage 比較快」


Hacker News / Bluesky / Lobsters 三方怎麼回應

HN:William Woodruff — 量大到我放棄 coordinated disclosure

William Woodruff(Trail of Bits 安全研究員)回應:

「我每週 triage 十幾份漏洞回報,多數都是真的(真的有缺陷),但對一般使用者的影響不明。這一直是中位數漏洞報告的常態,但現在量大到我更傾向放棄 coordinated disclosure。」

關鍵訊號:Woodruff 觀察到「flipside」— 既然這些 bug 對 LLM 來說很淺,那管理最差參與者反而變容易:如果有人寄來 slop(垃圾),可以直接 ban 掉,等下一個「更精心編排的 LLM 對同一個漏洞寄更好的回報」。他說:「一年前你沒辦法隨便 ban 研究員,現在可以了。」

Bluesky:Avery Pennarun — 事情還會再變一次

Avery(著名評論家、Tailscale 創辦人)認為:

「找到漏洞的能力有階躍式提升,但最終穩定結局只會是『更少漏洞被釋出』。一旦到了那時,標準會拉高,找漏洞又會變難。我們不該為短期動態做最佳化。」

Filippo 同意這個觀點,但強調「現在這個動態會持續到模型繼續變好的時候」。

Lobsters:Frederik Braun — 還是有「特殊」的漏洞回報

Frederik Braun(Curl maintainer)認為:

「特殊漏洞回報還是該被特殊對待。防禦方的責任是做好驗證、發布威脅模型,讓人們能達到新的、更高標準來構成一份『偉大的漏洞回報』。」

Filippo 同意:最終還是會有一個流程專門處理真正高風險 / 來自高度信任來源的回報。「下一個任務可能就是快速分類回報到特殊 vs 不特殊這兩個桶子。」


🚨 為什麼這件事重要

這篇 essay 表面上在談漏洞流程,深層是在講 security disclosure 這個產業機制在 AI 時代正在重構

重要性一:信任成本重新分配

過去一個 vendor 的 reputation 建立在「我們對資安研究員多好」。Bug bounty 平台( HackerOne、Bugcrowd)一年支付數億美元獎金。LLM 讓「研究員」這個身分去神秘化後,這套信任經濟的核心價值被稀釋。Maintainer 從「感謝研究員奉獻」轉為「防禦 LLM 軍備競賽」。

重要性二:防禦方優勢正在消失

傳統安全理論強調「defender needs to be right every time, attacker only needs to be right once」。但 Filippo 提出新觀點:LLM 讓攻擊者也不需要找到一個關鍵洞,他們可以平推所有 medium-severity 的洞,挑最好用的武器化。當 medium 洞夠多,defender 就失去「高牆」優勢。

重要性三:維運文化的轉向

Filippo 最後寫:「Triage, rapid remediation, and — as ever — prevention are the job now.」這意味著 open source maintainer 的工作內容正在從「感謝地收下禮物」變成「建立 CI 裡的 LLM 掃描、自動化補丁生成、即時 triage pipeline」。這對個人 maintainer 是沉重負擔 — 多數小專案根本沒人手做。


🚨 數據解讀 / 質疑

質疑一:LLM 真能找出「大多數」漏洞嗎?

Filippo 用「as good as almost any security researcher」這種模糊措辭,但沒有任何 benchmark 數字支撐。2025-2026 年雖然有 CyberGym、SecLLMHolmes 等開源 benchmark,但在 CVE 等級的真實複雜漏洞上,LLM 的表現遠低於頂級研究員。LLM 擅長 pattern match(找到「這個函式沒檢查 input length」),但對 protocol-level、state machine、race condition 仍力不從心。

真正的訊號雜訊比:Woodruff 觀察到「多數報告真實但影響不明」— 這不是 LLM 變強的證據,而是 LLM 找到的都是低懸果實,deep vulnerability 還是要靠頂級研究員。

質疑二:coordinated disclosure 真失效了嗎?

Filippo 沒給 embargo 機制實證案例。事實上 2025-2026 年仍有多起重大漏洞(如 Landfall 攻擊、Apache ActiveMQ RCE)走完完整 90 天 coordinated disclosure 流程,沒有任何觀察顯示攻擊者「從 LLM 提前生成 exploit 跳過 embargo」

機密協調機制運作的核心不是「漏洞內容有保密價值」,而是「patch 部署需要時間」。這個時間差仍然存在。

質疑三:攻擊者真有同樣 triage 瓶頸嗎?

Woodruff 與 Filippo 都假設「attacker 也要 triage 50 個候選漏洞」。但攻擊者跟 defender 的目標函數不同

  • Defender:每個漏洞都要驗證(false positive 代價高)
  • Attacker:只要找到一個能武器化的就好(false negative 代價低)

攻擊者其實是「先偵察再目標式生成 exploit」,他們不需要 triage 50 個,他們會讓 LLM 對單一高價值目標做深度攻擊。這跟 Filippo 的平推假設不太一樣。


參考連結

網友熱門留言 (3)

#1 William Woodruff(Hacker News) ▲ 142
我每週 triage 十幾份漏洞回報,多數是真的(真的有缺陷),但對一般使用者的影響不明。這一直是中位數漏洞報告的常態,但現在量大到我更傾向放棄 coordinated disclosure。
#2 Avery Pennarun(Bluesky) ▲ 87
事情還會再變一次。找到漏洞的能力有階躍式提升,但最終穩定結局只會是『更少漏洞被釋出』。一旦到了那時,標準會拉高,找漏洞又會變難。
#3 Frederik Braun(Lobsters) ▲ 64
還是有一些漏洞回報是特殊的。防禦方的責任是做好驗證、發布威脅模型,讓人們能達到新的、更高標準來構成一份『偉大的漏洞回報』。