編按:本文綜合整理自 Sakana AI 官方公告、Hacker News 討論串、Sakana Fugu Beta 部落格 及第三方評測 byteiota,並加入 Siami 編輯部觀點與分析。
核心賣點:一個 API 指揮全世界的前沿模型
Sakana AI 於 2026 年 6 月 22 日正式發布商用產品 Sakana Fugu,主打「多代理人系統即模型」(Multi-Agent System as a Model)的概念。Fugu 把目前最強的幾個前沿 LLM 收進一個池子,透過內部訓練出的小型指揮官模型,動態決定每個任務該由誰來做、要怎麼合作。
整個系統包裝成 OpenAI 相容的單一 API,開發者只要改一支 endpoint,就能享用「集體智慧」的協作效果,不必自己寫 LangChain、CrewAI 這類編排框架,也不用手動挑模型。
Fugu 不會疊加各模型的費用——它只會按投入的最強模型收取單一費率,這對成本控管是友善的設計。
目前分成兩個等級:
- Fugu:平衡性能與延遲,適合日常 coding、code review、聊天機器人等場景。
- Fugu Ultra:動員更深的專家代理池,專攻 Kaggle 競賽、論文重現、資安分析、專利調查這類高難度任務。
注意,Fugu 目前尚未在 EU/EEA 上線,官方表示正在處理 GDPR 等當地法規合規。
為什麼這件事重要
Sakana 走了一條與主流實驗室截然不同的路。當大家忙著把單一模型做大做強時,他們反過來問:能不能用一個相對小的「指揮官」模型,去整合已經存在的頂尖模型,讓整體表現超過任何一個單體?
這背後的關鍵是他們在 ICLR 2026 發表的兩篇論文——TRINITY 與 Conductor:
- TRINITY:輕量的「進化型 LLM 協調者」,把多個 LLM 分成 Thinker(思考)、Worker(執行)、Verifier(驗證)三種角色,根據任務動態分配。
- Conductor:用強化學習訓練出來的指揮官,會自己設計代理之間的溝通模式與提示詞,被官方稱為「communication topology」——也就是為每個輸入即時設計一套協作流程圖。
從 benchmark 結果看,這個路線確實跑通了:
| Benchmark | Fugu Ultra | Opus 4.8 | Gemini 3.1 Pro | GPT 5.5 |
|---|---|---|---|---|
| SWE Bench Pro | 73.7 | 69.2 | 54.2 | 58.6 |
| TerminalBench 2.1 | 82.1 | 74.6 | 70.3 | 78.2 |
| LiveCodeBench | 93.2 | 87.8 | 88.5 | 85.3 |
| Humanity’s Last Exam | 50.0 | 49.8 | 44.4 | 41.4 |
| GPQA-D | 95.5 | 92.0 | 94.3 | 93.6 |
| τ³ Banking | 20.6 | 20.6 | 8.4 | 20.6 |
| MRCRv2 | 93.6 | 87.9 | 84.9 | 94.8 |
SWE Bench Pro 上,Fugu Ultra 大幅領先 Opus 4.8(73.7 vs 69.2),這對工程類任務的實用性是重大訊號。
定價策略與商業模式
Sakana 採取了少見的雙軌定價:
1️⃣ Pay-as-you-go(企業用)
- Fugu Ultra(fugu-ultra-20260615):輸入 $5/百萬 token(context > 272K 時 $10)、輸出 $30/百萬 token(context > 272K 時 $45)。
- Fugu:依啟用的代理人數量計費,永遠只收最強那層的單一費率,不會疊加。
2️⃣ Subscription Plan(個人用)
- Standard:$20/月,輕量日常使用。
- Pro:$100/月,密集工作。
- 2026 年 7 月底前訂閱,第二個月免費。
這種把企業級編排技術以個人訂閱價($20 起)提供,等於把 Sakana 內部長期使用的「秘密武器」對外開放,市場策略上頗為激進。
業界反應:HN 社群的真實聲音
從 Hacker News 討論串 的 23 則回應,可以歸納出三種典型態度:
「他們募了將近 4 億美元,結果端出這個?有點令人失望。」——adamnemecek
「老實說,我本來以為 sakana.ai 在做更酷的東西。不過推出這種產品也合理⋯⋯」——prodigycorp
最尖銳的質疑集中在兩點:
- 「這不就是 OpenRouter 嗎?」 — 多位用戶質疑 Fugu 跟 OpenRouter Fusion 的差異。對此有 HN 用戶解釋,OpenRouter Fusion 是「ask N 個模型 + 合成器步驟」,Fugu 則是「訓練一個專門的編排者」來決定哪個模型最適合這個請求。Fugu Ultra 甚至會即時產生 multi-agent 流程圖。
- 「換了一個依賴而已」 — 用戶 embedding-shape 直接戳破官方話術:原廠說「無需單一供應商依賴」,但你用的還是 Sakana 的單一 API,本質上從依賴 OpenAI 變成依賴 Sakana。這個質疑點出了 vendor lock-in 換湯不換藥的本質。
「大家付 $200/月給 Anthropic、付 $200/月給 OpenAI、付 $200/月給 Cursor、付 $200/月給 Google,加起來沒到整整 $1024/月,所以你再付 $200/月給 Sakana 來統籌一切吧,why not。」——holistio
這則嘲諷回應底下引發了更深的共鳴:「$200/月」這個數字儼然成為 AI 訂閱的常態錨點,跟 AirPods 把 $300+ 耳機正常化的過程類似。
Siami 觀點
把這件事拉遠看,Sakana Fugu 真正在挑戰的不是 OpenAI 或 Anthropic,而是 「模型即護城河」(The model is the moat)這個命題。
rvz 在 HN 上的留言其實切中要害:
「免費跑本地模型,或甚至跑便宜的 DeepSeek V4。這些價格遲早會被競爭壓到 $0。」
這句話背後的產業意義是:
- 如果指揮官的價值真的這麼大,那 Sakana 等於宣告:「我們不需要自己做出最強模型,我們只需要知道怎麼用最強模型」。這個定位把 LLM 從「產品」降級為「原料」,重新定義了 AI 公司的價值分布。
- 如果指揮官的價值沒這麼大,那 Fugu 本質上就是 OpenRouter、AWS Bedrock 的 AgentCore、甚至 Hugging Face 的 Inference Endpoints 加一層自動化路由——換句話說,是個毛利會被快速壓縮的薄層。
從 Sakana 的 benchmark 來看,Fugu Ultra 在 SWE Bench Pro(73.7)領先 Opus 4.8(69.2)整整 4.5 分,這個差距不是「換皮」能做到的,背後的 Conductor 確實有獨特的編排邏輯。但這個護城河能不能守住,要看:
- Anthropic、OpenAI、Google 會不會自己做同等級的編排(很可能會,OpenAI 已推出類似的 routing);
- 開源 Conductor 論文會不會被快速複製;
- 客戶願不願意為「省下挑模型的麻煩」每月額外付 $20-$100。
數據解讀與質疑
幾個值得讀者留意的數據點:
- 50.0 vs 49.8 — Humanity’s Last Exam 上 Fugu Ultra 險勝 Opus 4.8,差距不到 1%,宣稱的「超越頂尖模型」說法略嫌誇大。
- 20.6 vs 8.4 — τ³ Banking 這個金融領域 benchmark,Fugu Ultra 大勝 Gemini 3.1 Pro(20.6 vs 8.4),但其他對手都跟 Opus 4.8 打成 20.6 平手,意味著這項可能是 Gemini 弱項而非 Fugu Ultra 強項。
- 官方說「不暴露出口管制風險」(無需透過受限的美國前沿模型),但 Opus 4.8、Gemini 3.1 Pro 都在 benchmark 裡——這個「不依賴單一供應商」的說法對企業客戶特別敏感,但實際代理池組成並未完整揭露。
- Fable 5 與 Mythos Preview 並未在 Fugu 代理池內(官方說明這兩者非公開),但被拿來當基準——這在 benchmark 比較上是常見操作,但讀者要理解 Fugu Ultra 沒跟這些「封閉旗艦」真正同台競爭。
結論:商業前景取決於生態系戰
Sakana 端出的 Fugu,本質上是把學術界(ICLR 2026 的 TRINITY、Conductor)的研究成果商品化,並透過 OpenAI 相容 API 大幅降低開發者採用門檻。
從使用者的真實回饋看(Sakana 官方公開的 5 位 early user 評價),Fugu 在 coding review、專利地圖分析、論文重現、資安評估等場景確實跑出了差異化的成果,特別是「自主運作 4 小時完成論文重現」這種長時間任務——這是單一模型難以做到的。
但 HN 社群普遍把 Fugu 定位在「整合得好但不是革命性突破」,質疑 Sakana 4 億美元募資的對價是否合理。
對 AI 從業者來說,真正的訊號不是 Fugu 本身,而是「指揮官模型」(orchestrator model)這個品類正式進入商業競爭。可以預期 Anthropic、OpenAI、Google 在未來 6-12 個月都會推出自家版本的 agentic routing,整個 LLM 市場的價值分布將從「單一模型強者恆強」轉向「誰能把多模型編成最強團隊」。
📌 編按:Sakana Fugu 個人方案 $20/月起、企業 API 採 pay-as-you-go,7 月底前訂閱第二個月免費。完整技術細節可參考 Sakana AI 官方公告 與 ICLR 2026 Conductor 論文。Siami 將持續追蹤主流模型廠商是否推出競爭性編排產品。
網友熱門留言 (5)