決策模型(decision model)會根據特定機率對內容進行分類,協助 AI 代理決定下一步該怎麼做。例如,你可以把一則客戶支援訊息當作輸入,問模型「這是不是緊急案件?」以及「應該由哪個團隊處理?」,決策模型會回傳帶有機率值的型別化答案(typed answers),你的程式就能依此分流案件、觸發升級流程,或是把任務交給真人處理。這代表不再需要人類在代理決策的迴圈中隨時待命 — 代理可以程式化地蒐集上下文、做出決策、執行任務,或在必要時升級給真人。
Cloudflare 內部已經在自家威脅情資(Threat Intelligence)團隊測試新的 Clef 模型,用來分類網站域名。只要把一個域名交給 Clef(搭配 Browser Run),它就能快速辨識該域名屬於哪些類別 — 例如,它可能會判斷某個域名有 95% 的機率是時尚網站、85% 是電商網站、< 1% 是釣魚網站。這整套流程包含抓取、渲染、分類,Clef 模型只需要 2.2 秒。相比之下,Cloudflare 最快的一般 LLM gpt-oss-120b 在同一個工作流程中要花 4.7 秒,而且只回傳兩項分類。對使用者來說,省下一半的延遲時間與更完整的分類結果,可以直接提升威脅情資團隊的工作效率,更快判斷惡意或合法域名。把這個場景推廣到任何需要快速程式化決策的情境,就能解鎖強大的代理工作流 — 自主決策、推理、執行。
在樂理中,clef 是放在五線譜開頭的符號,用來標示各線與各間對應的音高。決策模型就像樂譜上的 clef,因為它定義了上下文的範疇,以及接下來要彈奏的音符(動作)。我們選擇 Clef 作為這系列決策模型的名稱,正是因為它扮演類似的角色,而 CF 也呼應了 Cloudflare。
為什麼是 Clef?三大差異化設計
雖然市場上決策模型越來越多,Clef 仍有幾個獨特之處讓 Cloudflare 決定開源釋出。
- 第一,它有視覺編碼器(vision encoder),能接收圖片並對視覺內容進行分類。這與 Jev(TypeSafe 推出的純文字決策模型)完全不同,後者目前只支援文字分類。
- 第二,Clef 擁有 64k 的上下文視窗,是 Jev(32k)的兩倍,使用者能把更多輸入狀態塞進模型做分類。
- 第三,它在品質基準測試上表現強勁。 在 Jev Decision Index 定義的各項評估中,Clef 在主流決策模型裡名列前茅,並在他們自有的 TypeSafe 評測套件中於 4 個面向中贏得 3 個。尤其 Clef-flash 雖然更小更快,分數依然亮眼。
在 Cloudflare 跑過的 43 項基準測試中,Clef 系列在延遲上全面勝過對手(唯一例外是 Laya — 它犧牲品質換取速度)。搭配 Workers AI 的邊緣 GPU 部署,Clef 把網路延遲也壓到最低,可以直接放進代理的熱路徑(hot path)做即時決策,再交棒給 Workers AI 上的某個 LLM 採取行動。
curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef \
-X POST \
-H "Authorization: Bearer $CLOUDFLARE_TOKEN" \
-d '{
"model": "clef",
"state": "Checkout has been failing for every customer for the last hour.",
"questions": {
"urgent": {"type": "noul", "instructions": "Is this support request urgent?"},
"team": {"type": "choice", "instructions": "Which team should handle this request?",
"criteria": {"billing": "Payments, invoices, and refunds", "technical": "Outages, errors, and configuration", "sales": "Plans and upgrades"}},
"severity": {"type": "score", "instructions": "How severe is the customer impact?",
"criteria": ["No impact", "Minor", "Major", "Critical"]}
}
}'
Clef 也產生與 Jev 完全相容的強型別輸出,API 介面可直接互換。較大的 Clef 模型負責高精度場景,Clef-Flash 則適合對延遲極度敏感的決策。兩個模型都具備企業級的隱私保證:Cloudflare 不會讀取、儲存、或用你的請求來訓練(除非你主動使用他們的微調服務)。現在就能透過開發者文件開始試用,或到 Hugging Face 下載權重自行部署。
技術架構:為什麼 Clef 比 LLM 更快
事實上,Cloudflare 早在 Jev 公開那週就釋出過他們自家實驗性決策模型的相關文章。當時的 demo 是基於 DiffusionGemma 模型,透過暴露大型語言模型產生的 logprobs 來輸出確定性的機率值。這個初步方案靈感來自機器學習社群活躍貢獻者 Matt Mastracci,他向 vLLM 推論引擎提交了多個 PR,讓 DiffusionGemma 獲得更強的能力。
Clef 沿用這個概念,但換了不同的基礎模型。它以 Qwen 作為骨幹,並在 Qwen 之上做了後訓練(post-training)來對應決策模型的使用情境。 推論時,Clef 用 Qwen 跑一次 prefill-only pass,再平行對所有有效的 schema 選項打分。決策步驟是非自迴歸(non-autoregressive)的,沒有逐 token 生成的過渡文字,因此比自迴歸 LLM 顯著更快。
具體來看,Clef 與 Clef-flash 不靠生成中間文字,而是直接從骨幹內部表徵(internal backbone representations)衍生 schema 選項。這個方法仰賴一個特殊設計的兩階段注意力路由(two-stage attention routing)流程:每一個有效選項會萃取出與 prompt 相關的上下文,讓個別欄位參數能彼此交叉注意力(cross-attend),最後再回到原始 payload 一起評分。透過結合選項特定的證據路由、跨欄位聯合注意力、以及 schema 約束評分,整體架構得以整合。
- Clef 凍結 Qwen3.8-27B、Clef-flash 凍結 Qwen3.5-9B,同時對路由頭(routing head)與 rank-256 LoRA 進行聯合優化
- 後訓練結合了「對有效 schema 輸出做 label-smoothed cross-entropy」與「Brier loss 來精修機率校準」
- 訓練資料來自 Cloudflare 內部生成的合成資料集,涵蓋欄位順序、prompt、schema 結構的排列組合
- 他們還研發了 Reinforcement Learning for Calibrated Decisions(RLCD),對相鄰的序數選項給予部分獎勵、對完全精確的紀錄給予全額獎勵,再加上參考懲罰避免分佈漂移
成果就是 Clef 在三個面向同時達標:分類更精準、只輸出機率而不生成文字、比 Jev 與原生 Qwen 更快。
為什麼這件事重要
決策模型這個新品類在 2026 年突然爆紅,TypeSafe 的 Jev、GLiClass、Laya、OpenJev 等先後冒出來,連 Forbes 都在上週用「AI 決策成本降 100 倍、Vercel 與 Cloudflare 都搶著支援」的標題報導 Jev。這背後代表 AI 應用正在從「生成內容」走向「執行行動」,而後者需要的是又快又準、低成本的程式化決策。
Cloudflare 這次把 Clef 開源(Apache 2.0),同時把權重釋出到 Hugging Face,等於直接把決策模型這條賽道拉到企業級 GPU 邊緣基礎設施的層級來競爭。相較於 Jev 必須走 TypeSafe 自家的 API、且閉源,Clef 給了開發者一個可以本地部署、不被單一廠商綁定的選項。
在 HN 討論串上,已經有開發者指出 Jev 的速度本身有時反而是個問題(速度太快、需要更慢的模型搭配來做訊息分頁),這顯示決策模型的實戰部署還沒有標準答案,而 Clef 入場讓整個市場更熱絡。
從 Cloudflare 的策略面來看,這次發表其實是 Birthday Week 2026 的第一天主打,呼應他們喊出的「Agent Cloud」願景:Clef + Workers AI + Browser Run + AI Gateway + Containers 構成一個端到端的代理決策堆疊,等於宣告 Cloudflare 不再只是 CDN 與安全公司,而是要成為 AI 代理時代的作業系統底層。
數據解讀與質疑
定價方面,Cloudflare 把 Clef 與 Clef-flash 都放在 Workers AI 上託管。根據開發者 changelog 與第三方整理,每百萬 input tokens 的價格分別是 $0.24(Clef)與 $0.09(Clef-flash)。相較之下,TypeSafe 對 Jev 的定價是 $0.042/M input tokens、output 免費。也就是說,Clef-flash 的價格大約是 Jev 的兩倍,Clef 主模型則是 6 倍左右 — 開源模型本身免費,但用 Cloudflare 託管的推理服務反而比 Jev 貴,這點在 HN 留言區被不少人點出。
品質方面,Cloudflare 自家聲稱 Clef 在 Jev Decision Index 上「目前領先」,並在自家基準中於 4 項贏 3 項。不過這份評測的細節、樣本選擇、測試條件都還沒獨立第三方複現 — TypeSafe 自己也曾被質疑「用自家寫的基準來跑自家模型」。一位 HN 留言者直接表示,他試過多款聲稱「超越 Jev」的模型,最後大多在「看似簡單其實不簡單」的任務上失敗,建議看 benchmark 不如自己跑 SVG 鴕鳥遊戲這類實戰測試。
架構方面,Clef 採用 Qwen 凍結 + LoRA 聯合訓練是務實的選擇,但 Clef 27B 與 Clef-flash 9B 的尺寸並不小,要在雲端部署還是得有 GPU;對於想完全離線運行的開發者來說,硬體門檻比 Jev 系列(多在 1B 以下)高不少。實務上,如果用戶真的在意成本與延遲,自行在自家 GPU 上跑開源權重 + 加上自己的 LoRA,可能是比付費託管更划算的選項 — 這也是 Cloudflare 同時宣布 RL 微調服務的商業動機。
立即試用
- 官方入口:Cloudflare Workers AI 模型目錄 或 開發者 changelog
- 開源權重:Cloudflare/clef on Hugging Face
- 開發者部落格原文:Introducing Clef: our open-source decision models, and new RL fine-tuning platform
- RL 微調服務:先由 forward-deployed engineer(FDE)團隊手把手合作,未來會開放自助平台
- YouTube 介紹影片:Cloudflare Clef: Free Open Source AI Decisions in 38ms
編按:本文綜合整理自 Cloudflare 官方部落格原文、Cloudflare 開發者 changelog、Hugging Face 模型卡、Hacker News 討論串 與 developersdigest.tech 評測,並加入 Siami 編輯部觀點與分析。
網友熱門留言 (5)