← 返回 Siami 首頁

Claude Sonnet 5 正式發表:代理能力逼近 Opus 4.8 但價格只要六成

▲ 715 💬 386
Claude Sonnet 5 正式發表:代理能力逼近 Opus 4.8 但價格只要六成

Claude Sonnet 5 正式發表:代理能力逼近 Opus 4.8,但價格只有六成

編按:本文綜合整理自 Anthropic 官方公告,並加入 Siami 編輯部觀點與分析。

Anthropic 於 2026 年 6 月 30 日正式發表 Claude Sonnet 5。官方定位為「迄今最具代理能力(agentic)的 Sonnet 模型」,主打能自主規劃、調用瀏覽器與終端機工具,完成過去需要更大、更貴模型才能執行的長鏈任務。

從 Sonnet 3.5 到 Sonnet 5:代理 AI 的中間承擔者對許多開發者來說,「代理 AI 時代」是從 Sonnet 系列開始的——Claude Sonnet 3.5、3.6、3.7 是最早在編碼與工具調用上展現實用能力的模型。但近半年,代理能力最強的進步集中在 Opus 系列。Sonnet 5 的核心任務,就是把 Opus 等級的代理能力,下放到 Sonnet 級距。官方公布的測試結果顯示,Sonnet 5 在推理、工具調用、編碼、知識工作等多項指標上,都明顯優於前代 Sonnet 4.6,部分任務表現接近 Opus 4.8。但定價策略維持 Sonnet 系列的「中間承擔者」定位。

簡單說:Anthropic 不是要做一個新的旗艦,而是讓中等預算的開發者,也能用上前一代旗艦等級的能力。


定價:首發期間幾乎砍半,8 月底後才回到標準價

Sonnet 5 從發表日起,所有方案(Free、Pro、Max、Team、Enterprise)立即可用,在 Claude Code 與 Claude Platform 也同步上線。

期間輸入 (每百萬 tokens)輸出 (每百萬 tokens)
首發優惠(至 2026/8/31)$2$10
標準定價(9/1 起)$3$15
Opus 4.8(對照)$5$25

相較 Opus 4.8,Sonnet 5 的標準定價只有其 60%(輸入)與 60%(輸出);首發期間更降至 40% 與 40%。對需要大量 tokens 的代理工作流來說,這是實質成本結構的重新定義。


代理能力:Sonnet 5 vs Sonnet 4.6 vs Opus 4.8

官方提供了兩張「成本-性能曲線圖」,比較三個模型在不同「effort level」下的表現:

  • 代理搜尋 (BrowseComp):Sonnet 5(橘色線)在中等 effort 下,成本效率大幅優於 Sonnet 4.6;高 effort 時,部分任務可達到 Opus 4.8 等級的表現。
  • 電腦使用 (OSWorld-Verified):Sonnet 5 的覆蓋範圍比 Sonnet 4.6 寬得多,在某些場景可匹配 Opus 4.8。

Anthropic 也強調,Sonnet 5 與 Opus 4.8 之間,可以透過調整 effort level 找到最佳成本/性能平衡點——這代表開發者不再需要在「便宜但笨」與「貴但聰明」之間二選一。


早期用戶實測:從「寫測試」到「直接 ship PR」官方邀請了十家早期客戶提供使用心得,共通點是:Sonnet 5 完成了過去 Sonnet 模型會中途放棄的任務。

「我們把 Claude Sonnet 5 丟去做兩階段任務——更新 Salesforce 帳號層級、發送企業聯絡人的產品發布通知——它從頭到尾跑完了。這種事以前會卡在半路。」—— Daniel Shepard,Senior Engineer

「我要 Claude Sonnet 5 調查一個 bug。它沒被要求就自己寫了重現測試、實作了修復,然後把修改 stash 起來確認 bug 在沒有這個修改時會重現。一次完成。」—— Neel Chotai,Rust Engineer

「在 Lovable,我們把強大工具交到數百萬開發者手中。一個知道何時該說『不』的模型,跟知道如何建構的模型一樣重要。」—— Fabian Hedin,Co-founder

其他客戶(Lovable、Pace、ClickHouse、Eve、Cursor 等)的回饋也圍繞同一個主題:Sonnet 5 不只是「寫程式」,而是能「完成任務」。


安全評估:比 Sonnet 4.6 安全,比 Opus 4.8 仍略遜

Anthropic 的上線前安全評估結論:

  • 整體:Sonnet 5 的「不良行為」比率低於 Sonnet 4.6。
  • 代理安全:在拒絕惡意請求、抗 prompt injection 攻擊上表現更好。
  • 幻覺與逢迎:比率也低於 Sonnet 4.6。
  • 自動化行為稽核:分數比 Sonnet 4.6 更低(更安全),但仍高於 Opus 4.8 與 Claude Mythos Preview。
  • 資安能力:刻意未針對資安任務做訓練。Firefox 漏洞利用評測中,Sonnet 5 跟 Sonnet 4.6 一樣完全無法產出可用 exploit(0.0%),但「部分成功」的比率略高於 Sonnet 4.6——這被官方歸因於整體智慧的提升,而非資安專項訓練。由於在資安任務上比前代稍強,Anthropic 預設啟用了與 Opus 4.7/4.8 同級的資安防護,但比 Fable 5 上線時的嚴格防護寬鬆(因為整體資安風險被判定為「低」)。完整評估見 Claude Sonnet 5 System Card(連結待官方公布)。

為什麼這件事重要對開發者來說,Sonnet 5 的真正意義不是「又多了一個更好的模型」,而是代理 AI 的經濟結構正在改寫。過去一年,「能自主跑完多步驟任務」的模型幾乎都是 Opus 等級旗艦——每月數百萬美元的 API 帳單,把多數中小團隊擋在門外。Sonnet 5 把這種能力的門檻,從「Opus 等級預算」拉低到「Sonnet 等級預算」,而 Sonnet 4.6 的客戶在無需額外成本的情況下,就能升級到接近 Opus 4.8 的能力。更具體的影響:

  • 獨立開發者 / 個人創業者:首次能用合理成本運行「全自動編碼助理」式的 agent loop。
  • 企業內部工具:客服、資料分析、IT 自動化等場景,過去需要人類監督的長鏈任務,Sonnet 5 自主完成的比率明顯提高。
  • 開源社群:透過 Claude API 串接開源 agent 框架(AutoGPT、LangGraph、CrewAI 等)的項目,運營成本可望降低 40-60%。

數據解讀:三個值得追蹤的指標

  1. 首發期過後的轉換率:8/31 優惠結束後,多少現有用戶願意按標準價續用?如果續用率 > 70%,代表「便宜到客戶不再回到 Sonnet 4.6」。
  2. effort level 的實際分布:Anthropic 開放的「effort」調整機制,開發者實際會用 xhigh(最高)還是其實 medium 就夠?這決定了真實帳單 vs 預期帳單的差距。
  3. Opus 5 的時程:Sonnet 5 已經逼近 Opus 4.8,代表Anthropic 的模型迭代速度比預期快。如果 Opus 5 在 Q3 內公布,「中等價位 + 旗艦能力」的策略可能改寫整個 LLM 市場的定價結構。

編按:本文綜合整理自 Anthropic 官方公告,並加入 Siami 編輯部觀點與分析。

網友熱門留言 (4)

#1 Daniel Shepard (Senior Engineer) 0
我給 Claude Sonnet 5 一個兩段式任務——更新 Salesforce 帳號層級、發送產品發布通知給企業聯絡人——它從頭到尾完成了。這種事以前會卡在半路。對日常自動化來說,這是毫不猶豫的選擇。
#2 Neel Chotai (Rust Engineer) 0
我要 Claude Sonnet 5 調查一個 bug。沒被要求,它就自己寫了重現測試、實作了修復,然後把修改 stash 起來確認 bug 在沒有這個修改時會重現。一次完成。
#3 Fabian Hedin (Lovable Co-founder) 0
在 Lovable,我們把強大工具交到數百萬開發者手中。一個知道何時該說『不』的模型,跟知道如何建構的模型一樣重要。
#4 Yusuke Kaji (Cursor GM, AI for Business) 0
我們用 Claude Sonnet 5 跑數十個最困難的真實 pull request,它每個都自己跑到測試通過、驗證完成——讓工程師能專注在判斷、決策和最終簽核。