← 返回 Siami 首頁

Sakana AI 推出 Fugu 多代理人指揮系統:7B 小模型指揮 GPT-5、Claude、Gemini 在 SWE-Pro 奪冠

▲ 57 💬 23
Sakana AI 推出 Fugu 多代理人指揮系統:7B 小模型指揮 GPT-5、Claude、Gemini 在 SWE-Pro 奪冠

編按:本文綜合整理自 Sakana AI 官方公告Hacker News 討論串Sakana Fugu Beta 部落格 及第三方評測 byteiota,並加入 Siami 編輯部觀點與分析。

核心賣點:一個 API 指揮全世界的前沿模型

Sakana AI 於 2026 年 6 月 22 日正式發布商用產品 Sakana Fugu,主打「多代理人系統即模型」(Multi-Agent System as a Model)的概念。Fugu 把目前最強的幾個前沿 LLM 收進一個池子,透過內部訓練出的小型指揮官模型,動態決定每個任務該由誰來做、要怎麼合作。

整個系統包裝成 OpenAI 相容的單一 API,開發者只要改一支 endpoint,就能享用「集體智慧」的協作效果,不必自己寫 LangChain、CrewAI 這類編排框架,也不用手動挑模型。

Fugu 不會疊加各模型的費用——它只會按投入的最強模型收取單一費率,這對成本控管是友善的設計。

目前分成兩個等級:

  • Fugu:平衡性能與延遲,適合日常 coding、code review、聊天機器人等場景。
  • Fugu Ultra:動員更深的專家代理池,專攻 Kaggle 競賽、論文重現、資安分析、專利調查這類高難度任務。

注意,Fugu 目前尚未在 EU/EEA 上線,官方表示正在處理 GDPR 等當地法規合規。


為什麼這件事重要

Sakana 走了一條與主流實驗室截然不同的路。當大家忙著把單一模型做大做強時,他們反過來問:能不能用一個相對小的「指揮官」模型,去整合已經存在的頂尖模型,讓整體表現超過任何一個單體?

這背後的關鍵是他們在 ICLR 2026 發表的兩篇論文——TRINITYConductor

  • TRINITY:輕量的「進化型 LLM 協調者」,把多個 LLM 分成 Thinker(思考)、Worker(執行)、Verifier(驗證)三種角色,根據任務動態分配。
  • Conductor:用強化學習訓練出來的指揮官,會自己設計代理之間的溝通模式與提示詞,被官方稱為「communication topology」——也就是為每個輸入即時設計一套協作流程圖。

從 benchmark 結果看,這個路線確實跑通了:

BenchmarkFugu UltraOpus 4.8Gemini 3.1 ProGPT 5.5
SWE Bench Pro73.769.254.258.6
TerminalBench 2.182.174.670.378.2
LiveCodeBench93.287.888.585.3
Humanity’s Last Exam50.049.844.441.4
GPQA-D95.592.094.393.6
τ³ Banking20.620.68.420.6
MRCRv293.687.984.994.8

SWE Bench Pro 上,Fugu Ultra 大幅領先 Opus 4.8(73.7 vs 69.2),這對工程類任務的實用性是重大訊號。


定價策略與商業模式

Sakana 採取了少見的雙軌定價:

1️⃣ Pay-as-you-go(企業用)

  • Fugu Ultra(fugu-ultra-20260615):輸入 $5/百萬 token(context > 272K 時 $10)、輸出 $30/百萬 token(context > 272K 時 $45)。
  • Fugu:依啟用的代理人數量計費,永遠只收最強那層的單一費率,不會疊加。

2️⃣ Subscription Plan(個人用)

  • Standard:$20/月,輕量日常使用。
  • Pro:$100/月,密集工作。
  • 2026 年 7 月底前訂閱,第二個月免費。

這種把企業級編排技術以個人訂閱價($20 起)提供,等於把 Sakana 內部長期使用的「秘密武器」對外開放,市場策略上頗為激進。


業界反應:HN 社群的真實聲音

Hacker News 討論串 的 23 則回應,可以歸納出三種典型態度:

「他們募了將近 4 億美元,結果端出這個?有點令人失望。」——adamnemecek

「老實說,我本來以為 sakana.ai 在做更酷的東西。不過推出這種產品也合理⋯⋯」——prodigycorp

最尖銳的質疑集中在兩點:

  1. 「這不就是 OpenRouter 嗎?」 — 多位用戶質疑 Fugu 跟 OpenRouter Fusion 的差異。對此有 HN 用戶解釋,OpenRouter Fusion 是「ask N 個模型 + 合成器步驟」,Fugu 則是「訓練一個專門的編排者」來決定哪個模型最適合這個請求。Fugu Ultra 甚至會即時產生 multi-agent 流程圖。
  2. 「換了一個依賴而已」 — 用戶 embedding-shape 直接戳破官方話術:原廠說「無需單一供應商依賴」,但你用的還是 Sakana 的單一 API,本質上從依賴 OpenAI 變成依賴 Sakana。這個質疑點出了 vendor lock-in 換湯不換藥的本質。

「大家付 $200/月給 Anthropic、付 $200/月給 OpenAI、付 $200/月給 Cursor、付 $200/月給 Google,加起來沒到整整 $1024/月,所以你再付 $200/月給 Sakana 來統籌一切吧,why not。」——holistio

這則嘲諷回應底下引發了更深的共鳴:「$200/月」這個數字儼然成為 AI 訂閱的常態錨點,跟 AirPods 把 $300+ 耳機正常化的過程類似。


Siami 觀點

把這件事拉遠看,Sakana Fugu 真正在挑戰的不是 OpenAI 或 Anthropic,而是 「模型即護城河」(The model is the moat)這個命題

rvz 在 HN 上的留言其實切中要害:

「免費跑本地模型,或甚至跑便宜的 DeepSeek V4。這些價格遲早會被競爭壓到 $0。」

這句話背後的產業意義是:

  • 如果指揮官的價值真的這麼大,那 Sakana 等於宣告:「我們不需要自己做出最強模型,我們只需要知道怎麼用最強模型」。這個定位把 LLM 從「產品」降級為「原料」,重新定義了 AI 公司的價值分布。
  • 如果指揮官的價值沒這麼大,那 Fugu 本質上就是 OpenRouter、AWS Bedrock 的 AgentCore、甚至 Hugging Face 的 Inference Endpoints 加一層自動化路由——換句話說,是個毛利會被快速壓縮的薄層。

從 Sakana 的 benchmark 來看,Fugu Ultra 在 SWE Bench Pro(73.7)領先 Opus 4.8(69.2)整整 4.5 分,這個差距不是「換皮」能做到的,背後的 Conductor 確實有獨特的編排邏輯。但這個護城河能不能守住,要看:

  1. Anthropic、OpenAI、Google 會不會自己做同等級的編排(很可能會,OpenAI 已推出類似的 routing);
  2. 開源 Conductor 論文會不會被快速複製;
  3. 客戶願不願意為「省下挑模型的麻煩」每月額外付 $20-$100。

數據解讀與質疑

幾個值得讀者留意的數據點:

  • 50.0 vs 49.8 — Humanity’s Last Exam 上 Fugu Ultra 險勝 Opus 4.8,差距不到 1%,宣稱的「超越頂尖模型」說法略嫌誇大。
  • 20.6 vs 8.4 — τ³ Banking 這個金融領域 benchmark,Fugu Ultra 大勝 Gemini 3.1 Pro(20.6 vs 8.4),但其他對手都跟 Opus 4.8 打成 20.6 平手,意味著這項可能是 Gemini 弱項而非 Fugu Ultra 強項。
  • 官方說「不暴露出口管制風險」(無需透過受限的美國前沿模型),但 Opus 4.8、Gemini 3.1 Pro 都在 benchmark 裡——這個「不依賴單一供應商」的說法對企業客戶特別敏感,但實際代理池組成並未完整揭露。
  • Fable 5 與 Mythos Preview 並未在 Fugu 代理池內(官方說明這兩者非公開),但被拿來當基準——這在 benchmark 比較上是常見操作,但讀者要理解 Fugu Ultra 沒跟這些「封閉旗艦」真正同台競爭。

結論:商業前景取決於生態系戰

Sakana 端出的 Fugu,本質上是把學術界(ICLR 2026 的 TRINITY、Conductor)的研究成果商品化,並透過 OpenAI 相容 API 大幅降低開發者採用門檻。

從使用者的真實回饋看(Sakana 官方公開的 5 位 early user 評價),Fugu 在 coding review、專利地圖分析、論文重現、資安評估等場景確實跑出了差異化的成果,特別是「自主運作 4 小時完成論文重現」這種長時間任務——這是單一模型難以做到的。

但 HN 社群普遍把 Fugu 定位在「整合得好但不是革命性突破」,質疑 Sakana 4 億美元募資的對價是否合理。

對 AI 從業者來說,真正的訊號不是 Fugu 本身,而是「指揮官模型」(orchestrator model)這個品類正式進入商業競爭。可以預期 Anthropic、OpenAI、Google 在未來 6-12 個月都會推出自家版本的 agentic routing,整個 LLM 市場的價值分布將從「單一模型強者恆強」轉向「誰能把多模型編成最強團隊」。


📌 編按:Sakana Fugu 個人方案 $20/月起、企業 API 採 pay-as-you-go,7 月底前訂閱第二個月免費。完整技術細節可參考 Sakana AI 官方公告ICLR 2026 Conductor 論文。Siami 將持續追蹤主流模型廠商是否推出競爭性編排產品。

網友熱門留言 (5)

#1 Hacker News 用戶(david_shi) ▲ 28
他們的研究圍繞在打造領域專用模型,這點相當有趣——某種程度上就像 Karpathy 的 autoresearch,但指向在推論過程的每一步決定該選用哪個模型。如果成本成為更大問題,能選擇「極致效能」或「強效但省錢」這類分流會很重要。
#2 Hacker News 用戶(GolfPopper) ▲ 18
這是在開玩笑吧?
#3 Hacker News 用戶(prodigycorp) ▲ 22
老實說,我本來以為 sakana.ai 在做更酷的東西。不過推出這種產品也合理,因為它呼應使用這些模型時最直覺的想法:身上至少要有兩個 LLM,因為模型間互補,會填補彼此在知識或程式風格上的明顯空缺。他們也推出固定費率的訂閱方案挺有趣。我的印象是第一方供應商能做這件事是因為他們 API 推論的利潤率高達八成左右;其他做編排的人要嘛轉嫁成本,要嘛自行吸收。
#4 Hacker News 用戶(embedding-shape) ▲ 31
原廠寫「無需單一供應商依賴的前沿效能」⋯⋯請問這個「單一 API」實際上是不是多家供應商在跑?否則這不就把對一個供應商的依賴,換成對另一個供應商的依賴嗎?
#5 Hacker News 用戶(adamnemecek) ▲ 19
他們募了將近 4 億美元,結果端出這個?有點令人失望。