← 返回 Siami 首頁

Cloudflare 開源決策模型 Clef:Workers AI 託管、64k 上下文、Apache 2.0 釋出

▲ 360 💬 142
Cloudflare 開源決策模型 Clef:Workers AI 託管、64k 上下文、Apache 2.0 釋出

決策模型(decision model)會根據特定機率對內容進行分類,協助 AI 代理決定下一步該怎麼做。例如,你可以把一則客戶支援訊息當作輸入,問模型「這是不是緊急案件?」以及「應該由哪個團隊處理?」,決策模型會回傳帶有機率值的型別化答案(typed answers),你的程式就能依此分流案件、觸發升級流程,或是把任務交給真人處理。這代表不再需要人類在代理決策的迴圈中隨時待命 — 代理可以程式化地蒐集上下文、做出決策、執行任務,或在必要時升級給真人。


Cloudflare 內部已經在自家威脅情資(Threat Intelligence)團隊測試新的 Clef 模型,用來分類網站域名。只要把一個域名交給 Clef(搭配 Browser Run),它就能快速辨識該域名屬於哪些類別 — 例如,它可能會判斷某個域名有 95% 的機率是時尚網站、85% 是電商網站、< 1% 是釣魚網站。這整套流程包含抓取、渲染、分類,Clef 模型只需要 2.2 秒。相比之下,Cloudflare 最快的一般 LLM gpt-oss-120b 在同一個工作流程中要花 4.7 秒,而且只回傳兩項分類。對使用者來說,省下一半的延遲時間與更完整的分類結果,可以直接提升威脅情資團隊的工作效率,更快判斷惡意或合法域名。把這個場景推廣到任何需要快速程式化決策的情境,就能解鎖強大的代理工作流 — 自主決策、推理、執行。

在樂理中,clef 是放在五線譜開頭的符號,用來標示各線與各間對應的音高。決策模型就像樂譜上的 clef,因為它定義了上下文的範疇,以及接下來要彈奏的音符(動作)。我們選擇 Clef 作為這系列決策模型的名稱,正是因為它扮演類似的角色,而 CF 也呼應了 Cloudflare。


為什麼是 Clef?三大差異化設計

雖然市場上決策模型越來越多,Clef 仍有幾個獨特之處讓 Cloudflare 決定開源釋出。

  • 第一,它有視覺編碼器(vision encoder),能接收圖片並對視覺內容進行分類。這與 Jev(TypeSafe 推出的純文字決策模型)完全不同,後者目前只支援文字分類。
  • 第二,Clef 擁有 64k 的上下文視窗,是 Jev(32k)的兩倍,使用者能把更多輸入狀態塞進模型做分類。
  • 第三,它在品質基準測試上表現強勁。 在 Jev Decision Index 定義的各項評估中,Clef 在主流決策模型裡名列前茅,並在他們自有的 TypeSafe 評測套件中於 4 個面向中贏得 3 個。尤其 Clef-flash 雖然更小更快,分數依然亮眼。

在 Cloudflare 跑過的 43 項基準測試中,Clef 系列在延遲上全面勝過對手(唯一例外是 Laya — 它犧牲品質換取速度)。搭配 Workers AI 的邊緣 GPU 部署,Clef 把網路延遲也壓到最低,可以直接放進代理的熱路徑(hot path)做即時決策,再交棒給 Workers AI 上的某個 LLM 採取行動。

curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef \
  -X POST \
  -H "Authorization: Bearer $CLOUDFLARE_TOKEN" \
  -d '{
    "model": "clef",
    "state": "Checkout has been failing for every customer for the last hour.",
    "questions": {
      "urgent": {"type": "noul", "instructions": "Is this support request urgent?"},
      "team": {"type": "choice", "instructions": "Which team should handle this request?",
        "criteria": {"billing": "Payments, invoices, and refunds", "technical": "Outages, errors, and configuration", "sales": "Plans and upgrades"}},
      "severity": {"type": "score", "instructions": "How severe is the customer impact?",
        "criteria": ["No impact", "Minor", "Major", "Critical"]}
    }
  }'

Clef 也產生與 Jev 完全相容的強型別輸出,API 介面可直接互換。較大的 Clef 模型負責高精度場景,Clef-Flash 則適合對延遲極度敏感的決策。兩個模型都具備企業級的隱私保證:Cloudflare 不會讀取、儲存、或用你的請求來訓練(除非你主動使用他們的微調服務)。現在就能透過開發者文件開始試用,或到 Hugging Face 下載權重自行部署。


技術架構:為什麼 Clef 比 LLM 更快

事實上,Cloudflare 早在 Jev 公開那週就釋出過他們自家實驗性決策模型的相關文章。當時的 demo 是基於 DiffusionGemma 模型,透過暴露大型語言模型產生的 logprobs 來輸出確定性的機率值。這個初步方案靈感來自機器學習社群活躍貢獻者 Matt Mastracci,他向 vLLM 推論引擎提交了多個 PR,讓 DiffusionGemma 獲得更強的能力。

Clef 沿用這個概念,但換了不同的基礎模型。它以 Qwen 作為骨幹,並在 Qwen 之上做了後訓練(post-training)來對應決策模型的使用情境。 推論時,Clef 用 Qwen 跑一次 prefill-only pass,再平行對所有有效的 schema 選項打分。決策步驟是非自迴歸(non-autoregressive)的,沒有逐 token 生成的過渡文字,因此比自迴歸 LLM 顯著更快。

具體來看,Clef 與 Clef-flash 不靠生成中間文字,而是直接從骨幹內部表徵(internal backbone representations)衍生 schema 選項。這個方法仰賴一個特殊設計的兩階段注意力路由(two-stage attention routing)流程:每一個有效選項會萃取出與 prompt 相關的上下文,讓個別欄位參數能彼此交叉注意力(cross-attend),最後再回到原始 payload 一起評分。透過結合選項特定的證據路由、跨欄位聯合注意力、以及 schema 約束評分,整體架構得以整合。

  • Clef 凍結 Qwen3.8-27B、Clef-flash 凍結 Qwen3.5-9B,同時對路由頭(routing head)與 rank-256 LoRA 進行聯合優化
  • 後訓練結合了「對有效 schema 輸出做 label-smoothed cross-entropy」與「Brier loss 來精修機率校準」
  • 訓練資料來自 Cloudflare 內部生成的合成資料集,涵蓋欄位順序、prompt、schema 結構的排列組合
  • 他們還研發了 Reinforcement Learning for Calibrated Decisions(RLCD),對相鄰的序數選項給予部分獎勵、對完全精確的紀錄給予全額獎勵,再加上參考懲罰避免分佈漂移

成果就是 Clef 在三個面向同時達標:分類更精準、只輸出機率而不生成文字、比 Jev 與原生 Qwen 更快。


為什麼這件事重要

決策模型這個新品類在 2026 年突然爆紅,TypeSafe 的 Jev、GLiClass、Laya、OpenJev 等先後冒出來,連 Forbes 都在上週用「AI 決策成本降 100 倍、Vercel 與 Cloudflare 都搶著支援」的標題報導 Jev。這背後代表 AI 應用正在從「生成內容」走向「執行行動」,而後者需要的是又快又準、低成本的程式化決策。

Cloudflare 這次把 Clef 開源(Apache 2.0),同時把權重釋出到 Hugging Face,等於直接把決策模型這條賽道拉到企業級 GPU 邊緣基礎設施的層級來競爭。相較於 Jev 必須走 TypeSafe 自家的 API、且閉源,Clef 給了開發者一個可以本地部署、不被單一廠商綁定的選項。

在 HN 討論串上,已經有開發者指出 Jev 的速度本身有時反而是個問題(速度太快、需要更慢的模型搭配來做訊息分頁),這顯示決策模型的實戰部署還沒有標準答案,而 Clef 入場讓整個市場更熱絡。

從 Cloudflare 的策略面來看,這次發表其實是 Birthday Week 2026 的第一天主打,呼應他們喊出的「Agent Cloud」願景:Clef + Workers AI + Browser Run + AI Gateway + Containers 構成一個端到端的代理決策堆疊,等於宣告 Cloudflare 不再只是 CDN 與安全公司,而是要成為 AI 代理時代的作業系統底層。


數據解讀與質疑

定價方面,Cloudflare 把 Clef 與 Clef-flash 都放在 Workers AI 上託管。根據開發者 changelog 與第三方整理,每百萬 input tokens 的價格分別是 $0.24(Clef)與 $0.09(Clef-flash)。相較之下,TypeSafe 對 Jev 的定價是 $0.042/M input tokens、output 免費。也就是說,Clef-flash 的價格大約是 Jev 的兩倍,Clef 主模型則是 6 倍左右 — 開源模型本身免費,但用 Cloudflare 託管的推理服務反而比 Jev 貴,這點在 HN 留言區被不少人點出。

品質方面,Cloudflare 自家聲稱 Clef 在 Jev Decision Index 上「目前領先」,並在自家基準中於 4 項贏 3 項。不過這份評測的細節、樣本選擇、測試條件都還沒獨立第三方複現 — TypeSafe 自己也曾被質疑「用自家寫的基準來跑自家模型」。一位 HN 留言者直接表示,他試過多款聲稱「超越 Jev」的模型,最後大多在「看似簡單其實不簡單」的任務上失敗,建議看 benchmark 不如自己跑 SVG 鴕鳥遊戲這類實戰測試。

架構方面,Clef 採用 Qwen 凍結 + LoRA 聯合訓練是務實的選擇,但 Clef 27B 與 Clef-flash 9B 的尺寸並不小,要在雲端部署還是得有 GPU;對於想完全離線運行的開發者來說,硬體門檻比 Jev 系列(多在 1B 以下)高不少。實務上,如果用戶真的在意成本與延遲,自行在自家 GPU 上跑開源權重 + 加上自己的 LoRA,可能是比付費託管更划算的選項 — 這也是 Cloudflare 同時宣布 RL 微調服務的商業動機。


立即試用

編按:本文綜合整理自 Cloudflare 官方部落格原文、Cloudflare 開發者 changelog、Hugging Face 模型卡、Hacker News 討論串 與 developersdigest.tech 評測,並加入 Siami 編輯部觀點與分析。

網友熱門留言 (5)

#1 Twirrim 0
我們已經有用專用 ASIC 跑到每秒 16k+ tokens 的 LLM 了。Taalas 推出的 Chat Jimmy 就是用 ASIC 跑 Llama 3.1 8B,達到 17,000 tokens/秒。但說實話,這種速度對互動式使用反而是個問題 — 模型一回傳就是好幾段文字,你還得慢慢讀完才能消化。或許該把超快模型跟一般速度的模型配在一起:前者負責背景研究、寫程式這類不需要互動的工作,後者負責用舒服的步調把結果轉達給你。
#2 segmondy 0
很多人聲稱自己做出比 Jev 更強的模型,但真的有 Jev benchmark 可以驗證。我試過一堆所謂『超越 Jev』的模型,最後在看似簡單其實不簡單的任務上都會翻車。Cloudflare 沒拿 Clef 跟最強的開源對手比,我等下載完今晚就會拿它跟 Jev 在非 trivial 任務上對比看看。
#3 btown 0
合成資料是這一切的關鍵!跟五年前相比,我們現在有能免費產生大量完美標註多模態資料的『神諭』。能受惠於此的模型架構多到數不清,遠遠不只 LLM 而已。更厲害的是,LLM 自己就能實作你想要的任何架構概念,還能寫出訓練與評估的自訂工具。無論 LLM 能不能自我提升前沿能力,它們絕對能在自己合成資料上為其他模型的訓練加速。我們會看到過去 40 年的各種架構突然間產生跳躍式進步。
#4 tomrod 0
TypeSafe 作為一家公司最大的問題是:會不會有其他團隊做出在性能或成本上贏過 Jev 的模型?Cloudflare 的 benchmark 如果夠代表性、夠完整,那 Clef 的確贏過 Jev!但模型本身並不能保證市場份額 — 關鍵在於整合方式。況且很多開發者早就被一堆閉源模型搞到很受傷。
#5 AnthusAI 0
你沒辦法直接微調 Jev 本身,但可以訓練一個 ML 模型把 Jev 的輸出當輸入。這其實就是另一種『微調』整體模型的方式。如果你能持續標註資料,特別是在 feedback 裡解釋判斷依據,就能持續改善 Jev 分類結果。你也可以找出評分標準的新元素加進 Jev 產出的分類清單,然後讓那些元素變成你 ML 模型的新特徵。這是用資料讓 Jev 為基礎的分類模型持續對齊的兩個槓桿。