← 返回 Siami 首頁

Cloudflare 開源決策模型 Clef,27B 多模態搶攻 AI Agent 路由層

▲ 630
Cloudflare 開源決策模型 Clef,27B 多模態搶攻 AI Agent 路由層

Cloudflare 開源決策模型 Clef,主打快速判斷並整合 Workers AI

編按:本文綜合整理自 Cloudflare 官方部落格、The Register、Hugging Face 與 The Decoder 等一手報導,並加入 Siami 編輯部觀點與分析。

Cloudflare 在 2026 年 10 月 1 日一次推出兩款全新的開源「決策模型」(decision model):Clef(27B 參數)與 Clef-flash(9B 參數)。這是 Cloudflare Workers AI 團隊第一批「自己訓練」的模型,並非純粹代理其他廠商的開源權重。兩款模型都採用 Apache 2.0 授權,在 Hugging Face 開放權重下載,同時直接部署於 Cloudflare 自家的 Workers AI 推論平台。

跟一般對話式語言模型最大的差別在於,Clef 不會生成自然語言句子。開發者給它一段「狀態」(state,可以是文字、JSON、圖片或影片),再加上一份「型別化題目清單」(schema,例如 yes/no、單選、評分),它就直接回傳結構化的答案與對應機率。Cloudflare 把這種用法定位成 AI Agent 工作流裡的「路由層」——決定下一步該走哪個分支,而不是先寫一整段廢話再讓程式去解析。


效能:比 Jev 快 13 倍、自稱 7/10 基準領先

Cloudflare 官方公布的數字相當激進:在 43 個決策基準測試中,Clef-flash 的中位延遲為 38.8 毫秒,比 TypeSafe 的 Jev 的 524.1 毫秒快 13 倍;較大的 Clef 也比 Jev 快 2.5 倍。在準確率上,Cloudflare 自家報告指出 Clef 在 case-exact accuracy 達到 98.5%(Jev 為 95.8%),在 ToolRet 評測上的 nDCG@10 為 69.2。

在 Hugging Face 上的 Jev Decision Index——目前社群真正關注的獨立排行榜——Cloudflare 標記自家 Clef 為 61.2 分,Jev 為 57.9 分,Clef 暫時領先。但 Cloudflare 自己也承認,這些是「自報數字」(self-reported),尚未由獨立第三方重現。


技術細節:凍結 Qwen3.8 底座,加上 routing head 與 LoRA

從 Hugging Face 的模型卡可以看到,Clef 並非從零訓練的全新模型,而是凍結 Qwen3.8-27B 的主幹權重,再以合成資料集訓練一個 routing head 搭配 rank-256 的低秩適配器(LoRA)。Clef-flash 同樣凍結 Qwen3.5-9B。

這個設計的關鍵意義有兩點:

  • 多模態能力靠 Qwen 既有視覺編碼器:27B 版的 Clef 接受文字、JSON、圖片、影片四種輸入格式;9B 版的 Clef-flash 只接受文字。
  • 決策 head 與 LoRA 的分工:head 負責把狀態編碼到固定的「決策空間」,LoRA 負責讓模型在保持原 Qwen 語言能力的同時學會結構化輸出。訓練資料是 Cloudflare 自家生成的合成題目集。

由於 27B 底座是 Qwen3.8-27B,這意味著 Clef 的中文能力基本等同 Qwen 同等水準。對中文圈開發者來說,等於免費拿到一個 27B 等級的中文決策模型——這是 Jev(TypeSafe 主導,明顯偏向英文/TypeScript 生態)沒有的優勢。


同步推出:Workers AI 的 RL 微調平台

除了模型本身,Cloudflare 還在同一天推出了 Workers AI 的強化學習(RL)微調服務。開發者可以用自己的業務資料集,對 Clef 進行 RL 微調,調出一個專屬特定領域的決策模型。

這個 RL 平台的定位是:客戶端不需要自己架 GPU 叢集,Cloudflare 直接在自己的邊緣網路幫你跑訓練與推論。這跟之前 Cloudflare 在 2024 年 4 月推出 Workers AI GA 的「免管 GPU 即推論」邏輯一脈相承——差別在於這次連「fine-tuning」這一步也納入 Workers AI 的服務範圍。

對於企業用戶來說,這代表一個新的工作流:先用開源 Clef 跑通用決策 → 透過 Workers AI RL 平台做領域微調 → 部署回 Workers AI 邊緣節點,全程不需要離開 Cloudflare 生態系。


為什麼這件事重要

Siami 編按:決策模型不是新點子——Jev 在 2025 年底就引發過一波熱議。但 Cloudflare 這次開源的意義不只是「多一個對手」,而是把整個決策模型的基礎設施拉到開源 + 雲端一條龍的層級。

第一,Apache 2.0 加上 Qwen 底座,等於免費解鎖中文決策能力。Jev 雖然是開源,但它的訓練語料與社群資源明顯偏英文與 TypeScript 生態;Clef 直接站在 Qwen 3.8 這個全球前段班的中文模型之上,中文圈的客服分流、表單分類、工單路由等場景,立刻有了一個開箱即用的開源選項。

第二,Workers AI 整合把「決策模型」從研究名詞推向產品基礎設施。當一個模型能直接部署在全球 CDN 邊緣、用 Cloudflare 的 API 收費、又附帶 RL 微調平台,它就不再是 Hacker News 上的「看起來很酷的論文」——而是企業可以報帳採購的基礎設施。這跟當年把 LLM 從 OpenAI API 變成 AWS Bedrock 的轉變,是同一個模式。

第三,「不寫句子」這個設計哲學,會改變 AI Agent 的架構。現行 Agent 框架(例如 LangChain、AutoGen)幾乎都假設 LLM 會回傳自由文字,再由程式去解析。當決策模型回傳的是結構化 JSON + 機率,Agent 的 routing、tool selection、fallback 判斷都可以跳過一層「語言解析」的成本。Cloudflare 報的 38.8 毫秒中位延遲,部分就來自這個架構差異。


數據解讀與質疑

Siami 編按:Cloudflare 的數字很漂亮,但 13 倍速差、7/10 benchmark 領先、98.5% 準確率這些都是「官方自報」,社群與獨立分析師已經開始抓 bug。

第一個質疑點是基準測試的可再現性。在 Hugging Face 的 Jev Decision Index 上,Clef 的 61.2 分與 Jev 的 57.9 分,標記為 self-reported。獨立開發者社群(包括 akitaonrails、kmail 等技術部落客)已經指出,Cloudflare 的 43 個基準測試沒有公開完整評測碼——這跟真正獨立的 leaderboard(如 LMSYS Chatbot Arena 的作法)有差距。要等到有第三方拿同一份測試集在 Clef 與 Jev 上重跑一次,這些數字才算穩固。

第二個質疑點是**「13 倍速」這個數字的條件**。38.8 毫秒這個中位延遲是 Clef-flash(9B)在 Workers AI 自家網路上測出來的。換成本地部署、或換成其他雲端推論(例如 AWS Bedrock、Hugging Face Inference Endpoints),速度差距可能會縮小。開源權重讓本地部署可行,但實際延遲還得看硬體與推論框架(vLLM、TGI、Ollama)的調校。

第三個質疑點是**「決策模型會取代人類監督」的宣稱**。The Decoder 引述 Cloudflare 說法:「有了 Clef,人類不再需要進入 AI Agent 的審核迴圈」。這個說法在客服分流、表單分類等低風險場景或許成立,但在醫療、法律、金融等高風險場景,「模型給機率、人類拍板」這個分工不會因為模型變快就消失。Clef 的 1.2% 錯誤率在客服分流上可以接受,在醫療診斷上就是 1.2% 的誤診風險——這個差距 Cloudflare 沒有在 blog 中強調。


Siami 觀點:決策模型正在變成新的基礎設施層

把 Clef 跟 Jev 放在一起看,可以觀察到一個正在成形的產業趨勢:「決策模型」正在從一個有趣的實驗,變成 AI 應用堆疊裡的基礎層。

過去兩年,AI 應用堆疊的標準配置是「大型語言模型 + Prompt Engineering + Function Calling」。這個配置的痛點是:每一次決策都要 LLM 重新生成自然語言、再被解析成結構化指令。對高頻、低延遲的場景(客服分流、A/B 測試、即時推薦)來說,這個成本結構不划算。

決策模型(Clef、Jev、還有更早的 Laya、Supersonic Labs 的 Julia-1)走的路線是:把「決策」這件事從 LLM 抽離出來,變成一個專門的小模型。它不需要寫詩、不需要解釋、只要在給定的選項裡選一個、附上機率。對 Agent 框架來說,這等於多了一個專門的「路由晶片」。

Cloudflare 這次真正的商業策略,與其說是賣 27B 模型,不如說是把 Workers AI 從「推論市場」升級成「決策基礎設施」。開源 Clef 是入口,RL 微調平台是黏著劑,Workers AI 全球邊緣節點是計價單位。當你用 Workers AI 跑了第一個 Clef 推論、覺得速度不錯,接下來自然會想用 Cloudflare 的 RL 平台做領域微調,最後整個 AI 工作流就鎖進 Cloudflare 生態裡了。

這個模式,AWS 對 Open Source 軟體玩過、Google 對 Kubernetes 玩過。現在 Cloudflare 在 AI 推論層重新玩一次。


參考資料

網友熱門留言 (4)

#1 Reddit/r/LocalLLaMA 開發者 ▲ 487
Cloudflare 直接站在 Qwen3.8-27B 上做 decision head 加 LoRA,這個做法太聰明了——不用重新訓練一個 27B,卻能拿到 Qwen 既有的多模態能力。中文書寫的客服分流終於有開源選項。
#2 Hacker News 用戶 ▲ 312
13x faster 是在他們自家 Workers AI 上測的,本地跑 vLLM 或 TGI 應該會慢不少。等有人做出 Ollama 0.35 的真實 benchmark 比較準。
#3 Hacker News 用戶 ▲ 256
Self-reported 的 98.5% accuracy 我是不太信。任何用自己訓練集當 test set 的 paper 都會很漂亮。重點是要有第三方在 Jev Decision Index 上重跑。
#4 Twitter/X 開發者 ▲ 189
Apache 2.0 + 27B + 多模態 + Workers AI 整合 = 開源決策模型的天花板被打開了。Jev 的 TypeScript-only 鎖定讓它吃不下中文圈。