← 返回 Siami 首頁

Fireworks 推出 Ember-1:把 Kimi K3 「砍掉 40% 推理 token」,品質照舊,價格還更便宜

▲ 255 💬 144
Fireworks 推出 Ember-1:把 Kimi K3 「砍掉 40% 推理 token」,品質照舊,價格還更便宜

編按:本文綜合整理自 Fireworks AI 官方部落格、OpenRouter 模型頁、DigitalApplied 技術分析、Interconnects AI、Artificial Analysis 與 Hacker News 留言區,並加入 Siami 編輯部觀點與分析。


官方公告:Ember-1 把 K3 的 token 砍四成,品質不打折

Fireworks Research 於 9 月 23 日正式發表「開山之作」Ember-1——這是一款基於 Moonshot Kimi K3 的特化模型(specialized model),主打在維持 K3 品質的前提下,把推理階段消耗的 token 數量壓掉約 40%。Fireworks AI 官方部落格直接用一句話總結這次的定位:「half the tokens, same answers」。

官方公告的核心數字如下:

  • 基礎模型:Kimi K3(2.8 兆參數,Kimi Delta Attention + Attention Residuals 架構)
  • Token 節省:平均 40%(不同任務分布為 35–50%)
  • API 價格:相較 K3 略高(輸入 $4.13 / 輸出 $20.63 per 1M tokens,K3 為 $3.9 / $19.5),但因 token 用量大幅減少,實際任務成本反而下降
  • 可用範圍:上架 Fireworks AI 平台當天就同步在 OpenRouter、AIMLAPI、Blackbox 等多個第三方 gateway 上架
  • 上下文長度:1,048,576 tokens(100 萬級)
  • 發布時程:9/23 部落格公告,9/27 Hacker News 衝上 255 分、144 則留言

Fireworks 在部落格直接坦承:用戶主要痛點不是「K3 不夠聰明」,而是「K3 推理鏈太長,自動化程式開發場景下費用燒得太兇」——所以 Ember-1 的目標,是把 K3 還不錯的 coding 能力留下來,把那些「其實可以省略的思考」剪掉。


怎麼做的?不是蒸餾,是「專門把廢話剪掉」的後訓練

Fireworks Research 這次沒有走「用小模型學大模型」這條常見的蒸餾路。Ember-1 體積還是 2.78 兆參數(基本上就是完整的 K3),但用後訓練(post-training)方式,訓練模型跳過不必要的推理步驟——只保留「對最終答案有幫助」的思考路徑。

部落格提到的關鍵機制有兩條:

  1. 「思考預算」觀察出發:Fireworks 內部先觀察到一個普遍現象——用戶把 K3 開到「最高思考預算」時,模型會「過度推理」(over-reasoning),寫出來的中間步驟很多其實對最終 coding 結果沒貢獻
  2. 以代理指標驅動訓練:他們自建一套「專門智慧指標」(Specialized Intelligence Index),把模型在「真實工作負載」上的表現量化,然後用這個指標去調整後訓練的 reward function

「Ember-1 不是去解決一個抽象的 benchmark,而是直接解決用戶每天在用的程式開發工作流。」
— Fireworks Research 官方部落格

最後做出來的效果,就是在不犧牲品質的前提下,把平均推理 token 用量壓到 K3 的 60% 左右。這對大量呼叫 API 的 coding agent 場景意義特別大——因為對 coding agent 來說,token 費用就是最大的單一成本。


評測結果:在 7 個公開基準上打平 K3-max,在 Bedside Bench 設新前沿

Fireworks 強調 Ember-1 的驗證不是只在自家內部跑,而是用三方基準 + 客戶 A/B + 內部員工盲測三層驗證。具體成績如下:

公開基準

  • SWE-Bench 系列:Ember-1 在 SWE-Bench Verified、SWE-Bench Pro、Terminal-Bench 等 7 個公開 coding 基準上,與 K3-max 持平
  • 行業基準合輯:在 LiveCodeBench、Codeforces、AIME 2025、GPQA Diamond、ARC-AGI、MMLU Pro 等加總 23 個 benchmark 上,落在 K3 品質點的 ±1.5% 區間內

Specialized Intelligence Index(Bedside Bench)

  • Doximity Bedside Bench:在這個醫師驗證、橫跨 500 個臨床案例與 10 個專科分類的 benchmark 上,Ember-1 設下了新的成本-品質 Pareto 前沿——意思是同樣分數下它最便宜,同樣價格下它得分最高
  • FrontierSWE v2(Proximal):coding 技能評測,Ember-1 達到 FrontierSWE 的達標門檻
  • PWNBench-v0.1(Novee):live web app 的 agentic pentesting 評測,Ember-1 進入榜單前三

客戶 A/B 測試

在未公開名單的客戶生產流量下,Ember-1 在「輸出 token 數」維度上與 K3 有統計顯著差異——但「任務完成率」維度上沒有顯著差異。換言之:少講話,但一樣做對。

內部員工盲測

Fireworks 內部開發團隊在不知情的情況下,被偷偷把 K3 換成 Ember-1 跑了幾週——結果沒有人主動回報體驗有落差。這條對 Fireworks 來說反而是最有說服力的驗證。


為什麼這件事重要:LLM 進入「成本優化戰國時代」

Ember-1 不是新聞裡第一個嘗試「把強模型便宜化」的方法——開源蒸餾、量化、speculative decoding 都做過同樣的事。但這次有幾個訊號特別值得注意。

1. 「特化模型 vs 通用模型」的賽道正式開打

過去 LLM 競爭主要比「誰比較大、誰比較聰明」,現在戰場明顯分岔成兩條:

  • 通用路線:OpenAI GPT-6 Astra、Anthropic Claude Opus 5、Google Gemini——拚 benchmark 榜首
  • 特化路線:Fireworks Ember-1 這類「在特定任務上做最佳化」的模型——不求全能,只求「這個場景下最便宜」

Fireworks 同步推出的 Specialized Intelligence Index 就是這個賽道的基礎建設——專門用「真實生產工作負載」(clinical cases、coding tasks、pentesting)來評測特化模型,而不是泛用學術 benchmark。

2. Token 經濟學才是真正的護城河

LLM 公司常喊「我們比較強」,但企業用戶真正在乎的是單次任務成本。OpenRouter 上目前 K3 對 GPT-6 Astra 列出 「每 token 貴 1/3,但任務成本反而貴 2 倍」——原因是 K3 太愛想。Ember-1 把這個劣勢補回來,給客戶一個**「品質同 K3、價格實質下降」**的選項,這對企業 API 採購決策影響很大。

3. 後訓練正在變成「真正的護城河」

過去大家覺得後訓練(fine-tuning、RLHF、DPO)是「把現成模型調一調」,但 Ember-1 證明只要 reward function 設計得好,後訓練可以做出 model architecture 改不出的差異化——同一個 K3 weights,後訓練策略不同就會長出完全不同的「對外行為」。


數據解讀:40% 不是「平均數」是「很多任務其實可以到 50%」

部落格字面上寫的是「40% fewer tokens」,但細看不同 benchmark 類型分佈:

  • 簡單 coding 任務:token 節省約 50%(因為 K3 在這種任務上「想最多餘」)
  • 複雜多步驟任務:token 節省約 35%
  • 醫療專業問題(Bedside Bench):token 節省約 45%
  • 創意寫作類:節省幅度最小,約 25%(K3 在這類任務上相對精簡)

這代表 Ember-1 並非「無腦變短」——它判斷得出哪些思考有用、哪些可以省。這個能力本身就是後訓練做出來的「推理剪枝直覺」。

但要注意:Fireworks 自己也承認,在 K3 最擅長的那幾個 benchmark 角落,Ember-1 還是會微幅落後——大概 1–2 個百分點。換言之,如果你需要的是「K3 全力輸出的最高分」,Ember-1 不是 100% 替代品;但對 80% 的應用場景,任務成本下降 35–50% 比那 1–2% 的分數差距更有感。


業界回應:HN 留言區出現的兩個主要聲音

正面:「終於有人處理 token 經濟學問題」

「這個方向對。LLM 公司花 99% 時間在衝 benchmark,沒人處理 production cost。希望更多家跟進。」
— Hacker News 留言區(upvotes 約 140)

質疑:「不過是後訓練過度最佳化的 K3,會不會過擬合?」

「沒有開源 weights,就說 40% 節省跟同等品質——這是商業 release,不是學術 release。要驗證得等開源或第三方獨立跑一輪。」
— Hacker News 留言區(upvotes 約 80)

也有留言指出 Ember-1 沒有開源 weights(不像 K3 7/27 已經上 HuggingFace),是純 API 服務——這對企業用戶 OK,但開源社群就沒有辦法自行驗證或微調。


編按:Siami 編輯部提醒,Fireworks 目前並未公開 Ember-1 的完整訓練資料組成、後訓練 reward function 細節,以及「過度推理偵測器」是怎麼訓練的。所以「40% token 節省」這個數字,現階段只能信廠商說法,獨立驗證要等 OpenRouter 或 Artificial Analysis 跑完公開 benchmark 才會有完整答案。