編按:本文綜合整理自 Ars Technica 原文、Reuters 報導、Anthropic 官方公告、The Hacker News 與 CNBC,並加入 Siami 編輯部觀點與分析。
美國 AI 公司 Anthropic 7 月 1 日正式宣布,旗下兩款最先進模型 Claude Fable 5 與 Claude Mythos 5 從當天起向全球使用者重新開放存取。商務部長 Howard Lutnick 6 月 30 日致 Anthropic 的信函中證實,美國商務部已撤回 6 月 12 日的出口管制令;Mythos 5 自 6 月 26 日起也已在美國「可信賴機構」之間恢復存取。這場 18 天的禁令風暴,最初由 Anthropic 在 Mythos 5 上發現的「Amazon jailbreak」漏洞觸發,最終以 Anthropic 同意加裝新一代安全分類器、與商務部、亞馬遜、微軟、Google 等合作夥伴共同草擬《jailbreak 嚴重度產業共識框架》作收。
事件始末:從封網到解禁的 18 天
整起事件的時間軸極為緊湊,每一步都對 AI 產業政策框架投下震撼彈:
- 6 月 9 日:Anthropic 正式發表 Claude Fable 5 與 Mythos 5,後者透過「Project Glasswing」機制只開放給美國政府與少數可信賴的資安合作夥伴。
- 6 月 12 日:美國商務部下達出口管制令,要求 Anthropic 阻斷 Fable 5 與 Mythos 5 對「美國境外所有外國人」(含 Anthropic 自己外籍員工)的存取。
- 6 月 13–25 日:Anthropic 全面下線兩款模型;Mythos 5 被視為「對惡意行為者極具吸引力,可能被用於發現與利用軟體漏洞」。
- 6 月 26 日:商務部先局部放行,允許 Mythos 5 釋出給「可信賴的美國機構」。
- 6 月 30 日:Lutnick 正式致信 Anthropic,全面撤回 6 月 12 日管制令。
- 7 月 1 日:Fable 5 透過 Claude.ai、Claude Platform、Claude Code 與 Claude Cowork 全球同步上線;Mythos 5 同步升級供 Glasswing 合作夥伴使用。
這 18 天內,Anthropic 從「被監管機關一刀切封殺」到「與政府合作推出新一代安全機制」,過程被 Anthropic CEO Dario Amodei 形容為「公私協力的開端」。
Amazon jailbreak 是怎麼回事?
事件導火線是亞馬遜(Amazon)研究團隊回報的一個 jailbreak 技術——一種能繞過模型安全防護、讓模型產生違禁內容的提示工程。Anthropic 在自家 Mythos 5 與 Fable 5 上重現後發現,該 jailbreak 確實能讓模型在極少數案例中:
- 指出特定軟體漏洞
- 進一步生成「如何利用該漏洞」的程式碼示範
但 Anthropic 同時強調,相同手法對市面上其他較弱模型也同樣有效,包括自家的 Claude Opus 4.8、OpenAI 的 GPT-5.5、中國月之暗面(Moonshot AI)的 Kimi K2.7。也就是說,這次 jailbreak 並非 Fable 5 獨有弱點,而是整個產業共同面對的問題。
Anthropic 6/12 原始聲明:「我們的理解是,政府認為他們已察覺到一種繞過 Fable 5 安全防護的『jailbreak』方法。」
為了回應商務部要求,Anthropic 訓練了一個全新的安全分類器(safety classifier),專門針對亞馬遜回報的 jailbreak 技術做識別與阻擋。官方宣稱對該技術的封鎖率超過 99%,但代價是「良性請求被誤判的比例也會上升」——特別是在日常程式碼撰寫、除錯任務中,觸發防護時會自動 fallback 到 Claude Opus 4.8。
為什麼這件事重要
這不是單一公司與政府之間的零和衝突,而可能是 AI 產業「政府深度介入模型安全評估」時代的起點。Siami 認為這次事件有三層意義值得放大檢視:
第一層:公私部門的「強制合作」新模式成型。 過去 AI 公司是「自己寫 system card、自己發表」;這次則是「Amazon 提報漏洞 → 商務部下令 → Anthropic 重新訓練 → 跨公司(Amazon、Microsoft、Google)共同訂立框架」。商務部長 Lutnick 雖在信中保留「隨時可重新加碼管制」的權利,但這次合作的順暢程度,意味著美國政府已經摸索出對前線 AI 模型「30 天預先審查 + 持續監控」的實際運作 SOP。
第二層:Mythos 5 的「資安武器化」疑慮被實證。 Mythos 5 在 6/9 發表時就被定位為「有資安攻擊能力、必須透過 Glasswing 控管」的高階模型,亞馬遜這次回報的 jailbreak 證明了 Anthropic 自己的擔憂並非空穴來風。也正因為 Mythos 5 真的有能力被武器化,商務部才會罕見地對「單一商業模型」動用《出口管制條例》。這個案例將成為未來「類似 OpenAI GPT-5.6、Google Gemini Ultra 2」等前線模型被審查的判例基礎。
第三層:Anthropic 的「擁抱監管」立場首次得到回報。 過去兩年 Anthropic 是業界最積極倡議「政府強制安全測試」的異類,CEO Dario Amodei 6/10 公開支持聯邦層級強制審查法案。但「擁抱監管」並沒有讓他們免於 6/12 的禁令,反而在禁令後成為「最快完成合規」的模範生。CNBC 評論「Anthropic asked for regulation. Washington went much further」一語道破:政府實作的力道往往比企業倡議的更強。
數據解讀與質疑
表面數字(99% jailbreak 封鎖率)很亮眼,但 Siami 提醒三個值得追問的細節:
- 99% 背後的「剩下 1%」是什麼? Anthropic 坦承該攻擊目前仍能在「非常少數案例」中成功取得資安相關回應。這 1% 對一般使用者無感,但對「國家級攻擊者」而言,可能就是零時差漏洞的入口。Anthropic 把這 1% 視為「可接受的殘餘風險」,但這個口徑是否會被白宮與商務部接受,將是下一波觀察重點。
- 「良性請求誤判率」沒有公開數字。 Anthropic 承認新分類器「在例行程式碼與除錯任務中會更頻繁地把良性請求標記為可疑」。但究竟是多少?影響多少開發者日常 workflow?官方沒給量化指標。BridgeMind 創辦人在直播中已宣布要用自家 BridgeBench 對「被閹割的 Fable 5」做基準測試,這會是觀察「Fable 5 是否真的變笨」的第一份公開資料。
- Fable 5 與 Mythos 5「實為同一模型」。Anthropic 在 system card 中已明說,兩者「底層是同一個模型,差別只在 Mythos 5 解鎖部分資安防護」。換言之,這次「全球解禁」的 Fable 5,等於讓全球開發者都能用上接近 Mythos 5 能力的工具——只是多了一道分類器守門。這對 OpenAI 與 Google 的等價前線模型(GPT-5.6、Gemini Ultra 2)形成直接壓力。
Anthropic 自家評估:「較弱的競爭模型(GPT-5.5、Opus 4.8、Kimi K2.7)同樣會被該 jailbreak 突破。」—— 這代表商務部的管制對象事實上「只挑了 Anthropic 開刀」,其他公司目前並未被要求同步處理。
Fable 5 用量與定價細節
解禁並不代表 Fable 5 對所有使用者都無限制。根據 Anthropic 與多家合作夥伴公告:
- 7/1–7/7 期間:Fable 5 對 Pro、Max、Team、Enterprise 方案用戶提供「每週 50% 使用額度」內含。
- 7/7 之後:Fable 5 改為「用多少算多少」的 credit 制。
- 官方公開定價(per million tokens):輸入 $10、輸出 $50——明顯高於 Sonnet 5 與 Opus 4.8,是 Anthropic 史上最貴的公開 API 方案。
- Mythos 5:僅限 Glasswing 計畫成員(Amazon、Microsoft、Google 等)與美國政府機關使用,不對外販售。
對獨立開發者而言,這代表 7/7 之後要在 Fable 5 上做大型 agentic workflow,必須仔細計算 token 成本——特別是新分類器會讓「無害的 coding 請求」偶爾被 fallback 到 Opus 4.8,可能出現「以 Fable 5 計價、被 Opus 4.8 執行」的不透明帳單。
業界反應:政府介入模型測試將成新常態
Anthropic 在官方公告中明確表示,要把「與政府的合作」常態化:
- 預先部署存取:政府可在新模型公開前 30 天取得測試版評估。
- jailbreak 情資共享:所有 Glasswing 合作夥伴需即時通報 jailbreak 與濫用案例。
- 聯合研究資源:Anthropic 將指派專屬團隊與政府研究員對接。
- 產業框架草擬:與 Amazon、Microsoft、Google 共同建立「jailbreak 嚴重度分級」共識,作為業界與政府溝通的共通語言。
Anthropic 自評這套機制是「全球 AI 風險治理的範本」。但外界並非全無保留:
- Frontier Security Institute 執行長 Isaac Harris 對 Ars Technica 表示,這套「30 天預審 + 分類器 + 框架」雖然方向正確,但「對於真正決定模型安全與否的技術細節,公開程度仍遠遠不足」。他呼籲應有獨立第三方審查機制。
- OpenAI 的因應策略明顯不同:6/26 該公司主動將 GPT-5.6 等三款新模型「先小範圍釋出給可信賴夥伴」,繞過了商務部可能下達的禁令。這代表兩家前線公司在「政府介入程度」上開始出現策略分歧。
- 中國相關單位低調觀望:Anthropic 6 月稍早指控中國阿里巴巴對 Claude 發動「史上最大規模蒸餾攻擊」,中國官方與阿里方面均未正式回應。Fable 5 全球解禁後,預期雙方攻防將更為激烈。
對開發者、企業與政策制定者的意涵
這次事件對三類利害關係人都有立即影響:
對開發者:Fable 5 7/1 重新上線 Claude.ai 與 Claude Code,但 7/7 之後將進入「高價計費」階段。如果你正在跑大量 agentic workflow,建議先評估是否值得用 Sonnet 5 或 Opus 4.8 替代——除非你明確需要 Fable 5 的長 context 與深推理能力。
對企業 IT:Mythos 5 雖未對外販售,但 Anthropic 公告顯示「所有 Glasswing 合作夥伴的員工」皆可使用。如果你任職於 Amazon、Microsoft、Google 集團,這代表你能透過內部通道使用 Anthropic 當前最強模型——這對企業內部 AI 政策與資安規範是新的功課。
對政策制定者:CNBC 評論「Anthropic asked for regulation. Washington went much further」直指核心——政府對 AI 模型的管制力道正在快速超過產業自我監管的步調。Amodei 6/10 在 blog post 中呼籲國會「重新構想安全規範以因應 AI 可以從朋友變敵人的世界」,但從這次 18 天風暴來看,行政機關(商務部、BIS)早已走在立法機關前面。
後續觀察重點
Siami 編輯部建議持續關注以下四個指標:
- BridgeMind 等獨立基準的 Fable 5 vs. 原始 6/9 版本評測——確認「被閹割的 Fable 5」是否在實務表現上明顯下滑。
- Mythos 5 是否再次發生新 jailbreak——亞馬遜是這次吹哨者,下次可能是另一家科技公司。
- OpenAI GPT-5.6 的全球解禁時程——OpenAI 6/26 採取「主動小範圍釋出」策略,與 Anthropic「先禁後放」形成對照。
- 白宮 6 月底公布的「AI 安全審查 30 天制」行政命令後續落實進度——這次風暴是該命令的第一次實戰測試。
Anthropic 在結尾用了 Lord of the Rings 的比喻,把華府、商務部、亞馬遜、微軟、Google 形容為「試圖叫醒 Treebeard(樹鬍)的那群哈比人」。Treebeard 是中土世界最強大的樹人之一,行動緩慢但一旦醒來將勢不可擋。Anthropic 的訊息很清楚:政府這次醒了,AI 安全治理的典範正在成形。
網友熱門留言 (4)