← 返回 Siami 首頁

Anthropic 推出 Claude Sonnet 5.5 代理編碼分數暴漲、單位任務成本砍 30%

▲ 459 💬 312
Anthropic 推出 Claude Sonnet 5.5 代理編碼分數暴漲、單位任務成本砍 30%

編按:本文綜合整理自 Anthropic 官方公告、The Decoder 報導、Artificial Analysis 評測、Hacker News 討論串,並加入 Siami 編輯部觀點與分析。

Anthropic 在 2026 年 9 月 28 日正式發表 Claude 5.5 家族的第二位成員——Claude Sonnet 5.5,主打「比 Sonnet 5 更快、更便宜,卻幾乎追平 Opus 5.5」的代理編碼與知識工作能力。這款新模型在 Anthropic 內部的代理編碼評測 Terminal-Bench 4.0 上拿到 70.6%,相較 Sonnet 5 的 10.3% 是接近七倍的躍升,並已在 Amazon Web Services、Google Cloud、Microsoft Azure 同步開放下載。


模型定位與定價

Sonnet 5.5 在 Anthropic 的產品線中,被定位為「Opus 5.5 之下、Haiku 5.5 之上的中間層」。Anthropic 官方明確表示:

  • Opus 5.5:處理需要細緻判斷的複雜任務。
  • Sonnet 5.5:擅長範圍明確的日常工作、除蟲、製作精美文件、簡報與試算表;對設計也有不錯品味。
  • Haiku 5.5:主打高吞吐量、成本敏感的應用,預計未來數週內加入 Claude 5.5 家族。

定價方面,Sonnet 5.5 維持與 Sonnet 5 相同的牌價——每百萬 input token 2 美元、output token 10 美元、cache reads 0.20 美元。但因為每次任務消耗的 token 數明顯下降,單位任務成本實際降低達 30%,輸出速度也比 Sonnet 5 快 30% 以上,是 Anthropic 目前「最快的 Sonnet」。

這是 Anthropic 自 Opus 5.5 推出以來,第二次明確把「性價比」當作主打賣點的策略。對企業客戶而言,這意味著在 Opus 5.5 與 Sonnet 5.5 之間,將出現一條更清楚的「成本 vs 推理深度」分界線。


基準分數:與 Opus 5.5 差距急速縮小

Anthropic 在公告中列出多項代理編碼、知識工作、視覺理解的基準測試結果。在「Max effort」設定下,Sonnet 5.5 在多項指標幾乎與 Opus 5.5 打平:

領域評測Sonnet 5.5Opus 5.5Sonnet 5
代理終端機編碼Terminal-Bench 4.070.6%66.4%10.3%
代理編碼FrontierCode v1.1(主)46.2%(Max)54.4%42.4%
代理編碼CursorBench 4.055.5%57.8%34.1%
知識工作GDPval-AA v2.1184418461449
知識工作AA-Briefcase v1.1181118221359
跨領域推理Humanity’s Last Exam(含工具)64.5%67.7%54.9%
電腦操作OSWorld 2.1(partial)80.1%81.8%57.0%
視覺圖表Chartography(無工具)61.6%64.4%15.6%

幾個關鍵數字值得特別注意:

  • Terminal-Bench 4.0 從 10.3% 暴漲到 70.6%——這是評估模型在命令列環境下完成複雜多步驟任務的能力,Sonnet 5 在這個指標幾乎是「不及格」,Sonnet 5.5 直接跳到逼近 Opus 5.5 的水準。
  • AA-Briefcase、GDPval-AA 與 Opus 5.5 差距不到 1%——這兩個指標衡量真實世界的長時程知識工作。
  • Chartography 從 15.6% 拉到 61.6%——圖表識別是 Sonnet 系列過去的弱項,這次一口氣補上來。

Anthropic 同時強調:「基準分數只是模型能力的一面;在複雜、開放式、需要持續判斷的工作上,Opus 5.5 仍然明顯更強。」這句話避免外界過度解讀,也為 Opus 5.5 保留了定位。


成本與速度曲線:可調節「推論強度」

Sonnet 5.5 的另一個重要設計是**「effort level」(推論強度)**——使用者可依任務難度切換 Low、Medium、High、Xhigh、Max 五個等級,每提升一級,模型會花更多時間思考與檢查,但分數也會提升。

「當 effort 提高,模型通常會工作得更久、單位任務成本變高,但整體分數也會更高。圖表上越靠近左上角的點,代表每塊美元能換到的能力越高。」 ——Anthropic 官方公告

實測結果:

  • Medium effort(Claude 應用程式預設):在 Terminal-Bench 4.0 上,Sonnet 5.5 遠遠超過 Sonnet 5 的最佳成績,且單位任務成本不到 Sonnet 5 的十分之一。
  • High effort(Claude Platform 預設):在 FrontierCode 上,Sonnet 5.5 達到與 GPT-6 Sol 最佳成績持平的水準,但成本僅約其五分之一。
  • CursorBench:Low effort 即可超過 Sonnet 5 最佳成绩,成本同樣壓在十分之一以下。

對工程團隊來說,這代表可以針對「日常 coding review」開 Low、「複雜重構」開 High,而不必動用到 Opus 5.5。Atlassian 內部測試顯示,換用 Sonnet 5.5 後,Rovo Agents 的執行速度比 Sonnet 5 快 30%。


企業用戶的真實回饋

Anthropic 引用了 12 家企業客戶的試用回饋,這些公司橫跨遊戲、程式碼審查、客服、金融、雲端協作等領域:

  • Epic Games(遊戲引擎):「Sonnet 5.5 達到了原本要更高階模型才能做到的水準,能處理數萬行遊戲系統架構程式碼、維持回應速度,並完成多小時等級的任務。」
  • CodeRabbit(AI 程式碼審查):「Sonnet 5.5 的判斷力比 Sonnet 5 好很多,output token 用量顯著下降,Sonnet 5 過度依賴網路搜尋的毛病也消失了。」
  • Cursor:在 CursorBench 4.0 拿下 55.5%,僅次於 Opus 5.5,是性價比最高的選擇。
  • Base44:在 118 個真實 app 開發任務中,Sonnet 5.5 平均 3.6 次迭代就完成,Opus 5 需要 7.7 次;且失敗的 tool call 數最少。
  • Slack:在不更改任何 prompt 的情況下,Sonnet 5.5 在 Slackbot 的離線評測中幾乎全面勝過 Sonnet 5,步驟更少、output token 少 14%。
  • Zendesk:客服工單處理速度提升 20%。
  • Balyasny Asset Management:在 2,441 個金融任務中,平均每次回答只用 121k token(Sonnet 5 用了 497k)。
  • Box:在金融與醫療等敏感工作上,Sonnet 5.5 的資料覆核能力比前一代更精準,速度快 2.4 倍,token 用量少 12%。

這些案例共同指向一個訊息:Sonnet 5.5 不只是「更快」,而是「用更少 token 完成更高品質的工作」。對企業而言,這代表每月的 API 帳單會明顯下降。


為什麼這件事重要

Anthropic 在不到一週內連發 Opus 5.5 與 Sonnet 5.5,等於正式宣告 Claude 5.5 家族的「三層結構」成型:Opus 5.5(頂級判斷)、Sonnet 5.5(日常工作主力)、Haiku 5.5(高吞吐量)。這個產品線切割,與今年以來各家前沿模型把「推論強度」做成可調參數的趨勢一致——Anthropic 直接把這個概念產品化,讓客戶依任務難度挑選模型,而不是一律用最強的 Opus。

對企業 IT 與開發團隊來說,這代表三件事:

  1. 成本可預測:日常 80% 的工作可以交給 Sonnet 5.5,省下的 token 直接反映在月費。
  2. 能力天花板被推高:Terminal-Bench 4.0 從 10.3% 跳到 70.6%,代表 Sonnet 系列正式跨過「能處理複雜代理任務」的門檻,不再只是「輕量工作馬」。
  3. 資安與合規壓力上升:Sonnet 5.5 是第一款搭載完整網路安全防護的 Sonnet 模型(包括 distillation 防護),這對金融、醫療等敏感產業是把雙刃劍——能力越強,被蒸餾攻擊的風險也越高。

對 OpenAI、Google 而言,這無疑是壓力。Anthropic 的官方稿明確標出 GPT-6 Sol 在 Terminal-Bench 4.0 沒有公開成績,並用「GPT-5.6 Sol」做替代對照,等於向外宣告:在代理編碼這個領域,新版 Sonnet 已領先 GPT-6。


數據解讀與質疑

從獨立評測機構的數據來看,Artificial Analysis 給 Sonnet 5.5(high effort + fallback)的智力指數是 47,比 Opus 5.5(高 effort)低,但明顯高於 Sonnet 5。這個差距意味著:

  • 不要把 Sonnet 5.5 當作 Opus 5.5 的完全替代品。The Decoder 等媒體用的「nearly matches」措辭容易誤導——只有在特定推論強度與特定基準下,Sonnet 5.5 才逼近 Opus 5.5。
  • FrontierCode v1.1 上 Sonnet 5.5 Max 反而比 Xhigh 低,官方解釋是「Max 模式下會啟動 code-review skill,拆給子代理人並行檢查,但有兩個案例因此 timeout 或超出任務範圍」。這暗示「推論強度」並非單調遞增,過高的 effort 不一定帶來更好的結果。
  • AA-Briefcase 與 GDPval-AA 在發布前有個 bug 影響了 structured output 任務,官方已修,但第三方分數可能要等 Artificial Analysis 重跑才會更新。
  • ChatGPT 與 GPT-6 Sol 的 image understanding bug 同樣可能讓第三方對照數字低估對方實力。

對讀者來說,最實際的問題是:現在該不該把 Claude Code 的預設模型從 Sonnet 5 換成 Sonnet 5.5?Anthropic 官方的建議是肯定的——12 家企業客戶的數據顯示,至少在程式碼撰寫、code review、客服回覆這幾個場景,Sonnet 5.5 的單位成本與品質都勝過前一代。

但如果你的任務涉及「需要 Opus 等級的開放式判斷」,例如長篇策略規劃、複雜多步驟設計決策,Opus 5.5 仍然是更好的選擇。


上線與使用方式

Sonnet 5.5 已在以下平台同步上線:

  • Claude 官方應用程式(claude.ai)
  • Claude Platform(API)
  • Amazon Web Services(Bedrock)
  • Google Cloud(Vertex AI)
  • Microsoft Azure

開發者可在 Claude Platform 上用 claude-sonnet-5-5 模型名稱呼叫,預設 effort 為 High。若從 Sonnet 5 升級,且原本使用 thinking off 模式,需要先切換到 between_tools 設定才能繼續使用,詳細步驟見 Anthropic 的 migration guide。

Sonnet 5.5 同步提供「zero data retention」選項,企業客戶可以把資料保留政策維持在原本設定。

網友熱門留言 (3)

#1 Anthropic 官方 X ▲ 2150
Claude Sonnet 5.5 已在所有平台(AWS、Google Cloud、Microsoft Azure)上線,價格與 Sonnet 5 相同:每百萬 input token 2 美元、output token 10 美元。
#2 Mike Krieger(Anthropic 共同創辦人) ▲ 980
「We’re also launching Claude Sonnet 5.5 and Haiku 5.5 in the coming weeks. 這些模型會搭載與 Opus 5.5 相同的諸多改進。」
#3 Hacker News 留言 ▲ 612
「在 Artificial Analysis 智力指數中,Claude Sonnet 5.5 僅次於 Opus 5.5,名列第二。不過這個成績是在 max 推論強度下拿到的。」