← 返回 Siami 首頁

Fireworks 推出 Ember-1:用更少 Token 達成 Kimi K3 等級品質的精煉模型

▲ 255 💬 144
Fireworks 推出 Ember-1:用更少 Token 達成 Kimi K3 等級品質的精煉模型

編按:本文綜合整理自 Fireworks AI 官方部落格、MarkTechPost 報導、Digital Applied 分析,並加入 Siami 編輯部觀點與分析。

Ember-1:少一半 Token,同樣答案

Fireworks Research 在 2026 年 9 月 23 日推出 Ember-1,這是一款基於 Moonshot AI Kimi K3 後訓練(post-training)的精煉模型,主打少用 40% Token、保留 K3 等級品質。Fireworks 同時宣布這是「Specialized Intelligence」系列的開端,未來會持續推出針對特定用途優化的精煉模型。

Ember-1 在多項外部基準、兩家企業客戶的生產環境 A/B 測試,以及 Fireworks 內部工程師的日常程式開發工作負載上都通過驗證,品質與原版 K3 持平甚至略勝。對需要大量自動化程式開發、又想壓低 Token 成本的公司,這是目前性價比最高的選項之一。


Ember-1 是怎麼煉成的

使用者告訴 Fireworks:「我們想要 K3 的程式能力,但不想付那麼多錢。」問題在於 K3 的長思考鏈(reasoning trace)讓自動化程式開發在成本上吃不消。直接調低 K3 的 reasoning effort 也無效——品質掉太多。

要兼顧品質與 Token 預算,只能重新訓練。Fireworks 團隊跑了超過 50 組訓練實驗、超過 200 次評測,並開發新的訓練演算法讓模型學會「不要想太久」。整個過程都在自家的 Fireworks Serverless Training 平台上完成——不用自己管 GPU 叢集,有想法就能立刻開跑實驗,研發到上線的時間與成本都大幅壓縮。

訓練資料涵蓋數學、程式、指令遵循、對話、搜尋、工具使用、軟體工程等多元任務,並刻意收集單一任務與多輪互動的混合樣本。最終成果:在七個基準與兩家客戶的真實流量中,K3 的推理長度可以縮短 35–50% 而不犧牲正確率。


問題的本質:推理模型想太多

像 Kimi K3 這類推理模型,九成以上的 Token 都花在內部推理,而非最終答案。這個結構對單次請求來說成本已經偏高,在多輪代理(agentic)工作負載上更是災難——每一輪都會把所有先前的推理重新讀進 context,隨著輪數增加,context 長度會呈二次方成長。

K3 想很多,但很多時候是想得比任務需要的多。

Fireworks 內部實驗證明,這些「多餘的推理」其實可以完全不影響答案地被移除。這正是 Ember-1 的核心思路:保留 K3 的有效推理,剔除無效的部分。

但並非所有 K3 推理都是浪費——部分反思行為(revisiting assumption、responding to feedback、tracing outcome back)有助於模型從錯誤中恢復。Ember-1 的訓練目標就是「保留反思、剔除廢迴圈」。


Specialized Intelligence Index:Ember-1 在 Bedside Bench 設下新 Pareto 前緣

Fireworks 本週同步推出 Specialized Intelligence Index(SII),用各行業專家打造的「真實工作任務」來比較開放、封閉、與精煉模型的表現。

在 Doximity 的 Bedside Bench(500 個臨床案例、10 個專科分類,醫師驗證)上,Ember-1 在「品質/成本」座標系中對所有對手設定了新 Pareto 前緣,包含 GPT-5.6 Sol、GPT-6 Astra、Claude Opus 5。

換言之:在這個醫療推理場景,Ember-1 是當前最划算的選項。


跨產業基準:5 大主流 Coding 基準的全面驗證

Fireworks 在另外 5 個業界基準上比較 Ember-1 與原版 K3(K3 Low、K3 High、K3 Max)的「品質 vs 成本」。定價基準採公開 K3 API 牌價:uncached input $3/M、cached input $0.30/M、output $15/M。

基準NK3 LowK3 HighK3 MaxEmber-1Ember-1 vs K3 Max(成本變化)
Terminal Bench 2.18976.4%77.6%80.9%82.0%-51.9% / 少 $23.1
SWE-bench Verified50080.4%86.0%93.2%92.2%-15.5% / 少 $68.1
SWE-Interact756.7%13.3%21.3%20.0%-32.5% / 少 $60.8
DeepSWE 1.111355.8%62.8%66.4%75.2%-23.7% / 少 $126.9
τ-2 Bench Airline5064%64%64%66%-5.9% / 少 $0.3

Fireworks 的結論是:「要讓 K3 變便宜,正解不再是調低 reasoning effort,而是直接換成 Ember-1。」


客戶驗證:真實生產環境的 A/B 測試

基準只是參考,真正的考驗是能不能扛住真實生產流量。Fireworks 與兩家客戶合作,在其程式開發工作負載上跑 A/B 測試:

  • 兩個案例都達到約 35% Token 節省,品質持平
  • 大多數下游產品指標(任務完成率、成功率、失敗率)持平甚至改善
  • 其中一家客戶已將 Ember-1 部署到正式生產,並計劃逐步替換基礎模型

這是真正會讓 CFO 眼睛一亮的數字。


內部驗證:自家工程師「沒發現」換了模型

Fireworks 內部大量的程式開發流量都走自家推論服務。在客戶看到 Ember-1 之前,團隊先讓自家工程師在日常開發工作中實際使用,包含 vibe testing、規模化的真實任務。

最讓團隊驕傲的結果:沒有消息就是好消息。工程師在不知情的情況下繼續寫程式,沒有察覺底層模型已經換掉,同時消耗顯著較少的 Token。

對一個價值主張就是「同樣答案、更少 Token」的模型來說,無聲無息的內部切換就是最強的信號。


接下來會發生什麼

Ember-1 目前以 Research Preview 形式在 Serverless 上與原版 Kimi K3 並行提供。Fireworks 也推出新的「Research Releases」機制:開發者可以獲得為期兩週的 Serverless 試用期,依社群需求決定是否轉為永久模型。

同時 Fireworks 開放 Ember-1 的企業訓練支援——客戶可以用自有資料在自家場景下進一步優化模型。Fireworks Research 的長期路線是:「未來的開源模型不是『什麼都能做』,而是『專門做你的事』。」


為什麼這件事重要

Ember-1 不只是「同一個模型少花一點錢」這麼單純。它代表的是 AI 推論商業模式的一個分水嶺:

  • 後訓練市場正式成形:當閉源巨頭(OpenAI、Google)與開源旗艦(Kimi K3、DeepSeek V4、GLM 5)把基準推高到一定水位後,「在這個基礎上做精煉」變成一門獨立生意。Fireworks 的 Serverless Training 平台讓企業客戶不必養 GPU 叢集就能享受自己的精煉模型。
  • Token 經濟的轉折點:隨著代理式(agentic)應用普及,Token 消耗呈指數成長。能用一半 Token 達成相同品質的模型不只是省錢,而是直接決定一個產品能不能 scale。
  • 「Specialized Intelligence」概念驗證:用 SII 這套「真實行業任務」基準(而非學術玩具基準)來評比模型,會逐漸成為企業採購的真實指標。對台灣 B2B AI 服務商來說,這是產品定位的參考座標。
  • 中國開源模型的國際化管道:Ember-1 證明了中國頂尖開源模型可以透過美國 AI Infra 商的後訓練進入全球市場。Moonshot AI 提供基礎,Fireworks 提供客製化——這種分工會越來越常見。

對台灣開發者與新創來說,這個訊號很明確:與其追逐「更大的模型」,不如思考「更對的模型」。當 Llama、Qwen、Kimi 等開源基礎已經夠強時,下一輪的競爭會發生在精煉層。


數據解讀與質疑

1. Fireworks 的比較基準是否公允?Pareto 前緣是否名副其實?

Fireworks 在 Bedside Bench 上宣稱「Ember-1 設定新 Pareto 前緣,勝過 GPT-5.6 Sol、GPT-6 Astra、Claude Opus 5」。但這個比較有三個值得追問的地方:

  • Opus 5 的版本:Hacker News 上有用戶指出 Fireworks 引用的「Claude Opus 5」基準成績並沒有公開的 Opus 5.5 對應數據。要嘛 Fireworks 用的是某個內部版本,要嘛這個比較存在版本錯位問題。
  • 價格計算基準:表格中的成本是依「K3 的牌價」計算,但實際企業合約可能有折扣。在 Fireworks 上 K3 與 Ember-1 牌價相同,所以省下的就是思考長度,而非價格差。這個細節在原文被刻意淡化。
  • SII 是自家基準:SII 是 Fireworks 設計的基準,是否會偏向自家模型的優勢(如程式開發、Token 效率)需要觀察第三方的獨立驗證。

2. 「後訓練」並不等於「公開權重」

Ember-1 沒有公開權重、沒有 Hugging Face 模型頁、僅在 Fireworks Serverless 上提供。這跟「開源」完全不同。對在意資料隱私的企業,這是個紅旗。

同時,後訓練的具體演算法細節(loss function、reward shaping)Fireworks 並未公開。這讓「為什麼少 40% Token 仍能維持品質」成為一個黑盒子。

3. 35–50% Token 縮短是否真實?

官方數據是基於「K3 reasoning effort high / max vs Ember-1」的比較。但對真實使用者而言,K3 max 並不是預設設定——多數企業客戶已經在用 K3 high 或 K3 max。所以「vs K3 max」的對比雖然亮眼,但對多數用戶的「實際節省」可能比 35–50% 略低。

4. Kimi K3 的市場定位問題

Moonshot AI 在 2026 年 7 月推出 K3 時主打「2.8T 參數、1M context、頂級推理」,結果一個多月後 Fireworks 就能把 Token 成本砍掉 40%。這對 K3 的原始定位造成壓力——「頂級品質」與「頂級成本」開始被解耦,企業客戶也許會開始質疑「我們付的是 2.8T 的錢,還是 K3-max 的錢?」。


原始資料與延伸閱讀

網友熱門留言 (5)

#1 HN用戶 verdverm 0
重點是兩個模型在 Fireworks 上定價完全一樣(輸入 3 美元、輸入緩存 0.30 美元、輸出 15 美元),等於用相同價錢買到接近 K3-max 品質但少用一半 token 的版本,相當於油錢一樣但車子只開半程,省下的就是推理成本
#2 HN用戶 themgt 0
原文說「Ember-1 在 Bedside Bench 設定新 Pareto 前緣,涵蓋 GPT-5.6 Sol、GPT-6 Astra 與 Claude Opus 5」,但用搜尋驗證,Pareto 沒人提、Opus 5.5 連 hit 都沒有。部落格聲稱的基準對手是否真實存在,需要打個問號
#3 HN用戶 noodletheworld 0
「我們沒用客戶資料訓練」這種話當然好講,重點是大家本來就不信沒用。整篇文章讀起來就像一則產品廣告——『想自己微調嗎?我們現在也推出 Ember-1 的企業訓練支援』
#4 HN用戶 XCSme 0
我直覺覺得 Ember-1 可能不是純粹的 Kimi K3 微調,更像是 Qwen 與 Gemini 3 Flash 的混合模型。比較同一個 prompt 的輸出風格後,相似度高到不尋常
#5 HN用戶 XCSme 0
aibenchy.com 的測試顯示 GPT-6 Luna 在各項指標上都明顯優於 Ember-1,只是貴一點。預算寬鬆的場景沒有理由不選 GPT-6,Ember-1 的強項是成本敏感的批次代理任務