四十八個德瑞克

Cloudflare加入decision model戰局,jev多一個挑戰者

發光的五線譜譜號延伸成分支決策節點網絡的抽象插圖

譯註:Cloudflare 於 2026 年 10 月 1 日發表開源「決策模型」(decision model)Clef 與 Clef-flash,宣稱在 Typesafe Jev 自家的評測指標上領先,並同步發表強化學習微調平台。這篇翻譯全文收錄其架構與基準數字,後半整理 Hacker News 157 則討論——網友一方面肯定開放權重,另一方面質疑「決策模型」概念不新、Cloudflare 自家基準的可信度,實測延遲與價格也未必勝過 Jev。


Cloudflare Blog 原文翻譯

〈Introducing Clef: our open-source decision models, and new RL fine-tuning platform〉

Cloudflare Blog|2026 年 10 月 1 日

作者:Michelle Chen、Alex Reneau、Kevin Flansburg


過去幾週,圍繞「決策模型」(decision models)有非常多討論,例如 Typesafe AI 的 Jev System One 模型。分類模型(classifier models)雖然存在已久,但 Jev 為 AI 世界引入了新的決策模型概念——一個能便宜、快速且一致地產生有界結構化輸出的模型,當工作流程中需要做出「決斷」時就能接進去。這類模型足夠聰明,可以在任何輸入組合上運作,而不需要為了納入新的分類類別而不斷重新訓練模型。這與大型語言模型(LLM)的世界形成對比:LLM 大體上是非決定性的,但其開放性足以進行推理,並為 agentic 工作負載產生文字與工具呼叫。

今天,我們在 Workers AI 上發布兩個由 Cloudflare 訓練的決策模型:Clef 與 Clef-flash。以 Jev Decision Index 評測來看,Clef 目前是領先者,完整結果可見即時基準測試展示網站。這些模型更聰明、更快,而且完全相容 Jev API,讓你輕鬆試用這些託管模型。我們也將這些模型以 Apache 2.0 授權在 Hugging Face 上完全開源,供你本地執行與自行實驗。

最後,我們很高興首度推出全新的強化學習(RL)產品,允許客戶微調 Clef 以符合自己的使用場景。

什麼是決策模型?

決策模型進行分類,依據特定機率幫助 agent 決定該如何行動。例如,你可以傳入一則客服訊息(輸入),詢問它是否緊急、該由哪個團隊處理。決策模型會回傳帶機率的型別化答案(輸出),你的程式碼可據此路由工單、觸發升級通報,或轉交人工處理。這意味著 agentic 決策不再一定需要人類在迴圈中(human-in-the-loop)——agent 能以程式化方式蒐集脈絡、做出決策並對任務採取行動,或在需要時轉交人工。

更具體地,在 Cloudflare 內部,我們一直在測試新的 Clef 模型,協助威脅情報(Threat Intelligence)團隊對網站網域進行分類。把一個網域交給 Clef(搭配 Browser Run),它能快速辨識該網域所屬的類別——例如,它可能以 95% 的機率判定某網域是時尚網站、85% 是電商、低於 1% 是釣魚網站等。這次分類,我們的 Clef 模型花費 2.2 秒完成抓取、渲染與分類網站;相比之下,我們最快的通用 LLM gpt-oss-120b 在相同工作流程中花了 4.7 秒,而且只回傳兩個分類結果。身為使用者,你可以想像延遲減少 2 倍、結果更豐富,如何幫助我們改善威脅情報工作流程、更快識別惡意或正當網域。將此推廣到任何需要快速做出程式化決斷的場景,你就能解鎖強大的 agentic 工作流程,自主地決策、推理與執行。

在樂理中,譜號(clef)是放在五線譜開頭的符號,用來指定各線與各間的音高名稱。決策模型與樂譜號類似,因為它有助於定義脈絡的範圍,以及隨後的音符(行動)。我們選擇 Clef 作為這一系列決策模型的名稱,正是因為它有相似的用途,而其中的 CF 則呼應 Cloudflare。

Clef 與其他決策模型有何不同?

雖然市場上決策模型日益擁擠,Clef 仍有一些讓我們興奮、值得公開發布的獨特之處。第一,它有視覺編碼器(vision encoder),因此能接收圖片並分類視覺內容。這與 Jev 不同,Jev 目前只做文字分類。其次,我們的模型有 64k 上下文視窗(相較於 Jev 的 32k),讓使用者能塞進更多輸入狀態供模型分類。

第三,我們的模型準確且強大,在多項品質基準上與市場其他決策模型相比具有競爭力。我們在下方精選了若干對 Jev Decision Index 定義之「決策」重要的評測,並對市場上較熱門的模型進行評分。請看下方的基準表,或到我們的即時 decision index 展示網站查看分數:

基準測試 Clef Clef-flash Jev DiffusionGemma Jev Kev 9B Laya
BFCL · case exact 98.47 98.76 95.75 96.52 94.51 38.13
ToolRet · nDCG@10 69.19 66.43 65.28 61.21 64.26 12.69
API-Bank · accuracy 91.93 93.11 88.19 83.66 56.30 11.41
Home appliances · case exact 82.95 97.73 52.27 42.05 25.00 0.00
When2Call · accuracy 72.37 65.58 80.97 75.44 49.62 11.94
BANKING77 · macro-F1 94.20 90.93 79.74 74.28 84.83 14.29
CLINC150+OOS · macro-F1 97.43 66.77 89.27 83.49 79.03 3.19
BRIGHT · nDCG@10 45.91 39.26 47.52 42.94 38.53 19.90
Amazon ESCI · macro-F1 57.48 57.39 55.21 53.37 49.22 24.40
PhishNChips · accuracy 79.60 75.05 62.55 85.35 50.75 50.15

我們也在 Typesafe 自家的評測套件上跑了基準,Clef 系列表現良好,在 4 項領域中打贏 Jev 3 項。值得注意的是,考慮到 Clef-flash 快上許多,它的表現尤其出色:

工作流程 Clef Clef-flash Jev
發票處理 64.7 57.1 61.8
客戶服務 76.3 77 76.0
安全事件 62.9 61.7 61.7
Agent trace 觀測性 68.5 69.8 71.6

在我們執行的 43 項評測基準中,Clef 系列在延遲上擊敗其他決策模型(唯有 Laya 極快,但在上述品質基準上有所取捨):

基準測試 Clef Clef-flash Jev DiffusionGemma Jev Kev-9B Laya
中位延遲 · ms 209.3 38.8 524.1 84.4 51.4 5.8
p95 延遲 · ms 238.6 122.4 536.0 211.2 187.9 222.5

除了模型本身的延遲優勢之外,我們的 Clef 模型託管在 Workers AI 上。由於託管於 Cloudflare 基礎設施,我們能善用邊緣的 GPU,帶來低網路延遲與更快的決策。這代表你可以把 Clef 放進 agent 的熱路徑(hot path)做決策,再搭配 Workers AI 上的任一 LLM 來執行動作。


curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef} \
  -X POST \
  -H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \
  -d '{
    "model": "clef",
    "state": "Checkout has been failing for every customer for the last hour.",
    "questions": {
      "urgent": { "type": "noul", "instructions": "Is this support request urgent?" },
      "team": {
        "type": "choice",
        "instructions": "Which team should handle this request?",
        "criteria": {
          "billing": "Payments, invoices, and refunds",
          "technical": "Outages, errors, and configuration",
          "sales": "Plans and upgrades"
        }
      },
      "severity": {
        "type": "score",
        "instructions": "How severe is the customer impact?",
        "criteria": ["No impact", "Minor", "Major", "Critical"]
      }
    }
  }'

Clef 也產生與 Jev 類似的嚴格型別化輸出,且完全 API 相容,因此替換非常容易。較大的 Clef 是更強的精準模型,而 Clef-Flash 則適合延遲關鍵的決策。這些模型已達企業級,我們保證不會讀取、儲存或以你的請求與回應進行訓練(除非你想使用我們下方介紹的微調產品)。你可以今天就從開發者文件開始使用 Clef 模型,或在 Hugging Face repo 上玩玩開源模型。

如果你希望有人協助針對特定工作負載調校 Clef,我們也提供微調服務——先由前部署工程師(FDE)團隊手把手合作,之後再推出自助式微調平台,供客戶訓練並將模型重新部署到 Cloudflare。

我們如何訓練 Clef

在 Jev 推出的同一週,我們也發布了自家決策模型的一些實驗。我們的展示說明了如何改造 DiffusionGemma 模型——透過揭露 LLM 產生的 logprobs,使其輸出決定性機率。我們的初步方法建立在 Matt Mastracci 的獨立研究之上,他長期活躍於機器學習(ML)社群,分享新想法並向 vLLM 推理引擎提交 pull request,以強化 DiffusionGemma 的支援。

Clef 建立在這個概念之上,但使用了不同的基座模型作為骨幹。我們目前以 Qwen 作為基座模型,並對其進行後訓練以符合決策模型的使用場景。推理時,Clef 先用 Qwen 做一次僅預填(prefill-only)的傳遞,然後平行地對所有合法的 schema 選項打分。決策步驟是非自回歸(non-autoregressive)的,沒有逐個 token 產生的中間文字,使 Clef 明顯快於自回歸 LLM。Clef 與 Clef-flash 不是先產生中間文字再產出結構化答案,而是直接從內部骨幹表徵(backbone representations)導出 schema 選項。這種方法依賴專門的兩階段注意力路由過程:每個合法選項抽取與提示詞相關的脈絡,讓各個欄位參數能交叉注意(cross-attend)其他欄位、並在打分前回頭注意原始輸入。藉由利用詞彙先驗(lexical prior),模型在各選項之間保留語意意圖。最終,這個架構統合了選項專屬的證據路由、跨欄位聯合注意力,以及受 schema 約束的打分。

透過凍結 Qwen3.8-27B(Clef)與 Qwen3.5-9B(Clef-flash),我們對路由頭(routing head)與 rank-256 低秩適配器(LoRA)進行聯合優化。我們的後訓練對合法 schema 輸出使用標籤平滑交叉熵(label-smoothed cross-entropy),並搭配 Brier loss 來改善機率校準(probability calibration)。訓練使用我們自家的內部合成資料集,對欄位順序、提示詞與 schema 結構進行排列變化。我們還開發了「校準決策的強化學習」(RLCD, Reinforcement Learning for Calibrated Decisions)作為次要優化目標:對相鄰的序數選項給予部分學分、獎勵完全精確的記錄輸出,並施加參考懲罰以防止分佈偏移,從而帶來更好的準確度與泛化能力。

這意味著我們藉 Clef 達成了幾項新穎的成果:提升了模型在分類上的準確度;將其約束為只輸出機率而非文字生成;並使其比 Jev 與基座 Qwen 模型更快。

微調如何擴展 Clef 的能力

我們聽到很多內部場景需要微調 Clef,才能導入 Cloudflare 的 agentic 工作流程。例如,內部團隊希望有一個分類模型能評估信任與安全(Trust & Safety)提交內容、協助分類 Cloudflare 支援請求,甚至內建到我們的 Bot 產品中,判斷某個爬蟲是好機器人還是壞機器人。

這些使用場景極為特定,而我們有多年已標註的決策資料可用來訓練專用分類器。微調模型時,你可能會犧牲部分通用能力,換取特定領域的更高準確度。由於 Cloudflare 擁有橫跨多個領域、超過 15 年的網路資料,我們可以微調模型以契合這些特定場景,比通用 Clef 更準確、也更快。我們已與內部團隊合作,研究如何對 Clef 進行後訓練、打造強大的 ML 模型,以提升影響力並改善 Cloudflare 全公司的流程。這些內部團隊與使用場景正是我們新 FDE 微調團隊的下一個職責範圍,也是我們強化學習(RL)產品的基礎。

我們新的 RL 服務

我們提供一項服務,透過實戰經驗豐富的 FDE 團隊協助客戶微調 Clef 以符合其工作負載。從中,我們將汲取親手實作的經驗,打造一個自助平台,讓客戶能擷取資料、微調並重新部署模型,全程都在 Cloudflare 上完成。

這其實醞釀已久——我們一直在建構 AI 平台所需的正確原語(primitives),以便能打造自訂 RL 產品。Jev 引起的興趣顯示了市場對「快速、小型、專用分類模型」的需求,我們選擇這一點作為利基,開始實驗 RL 環境。

為此,我們利用已在 Cloudflare 平台上建好的原語:

這結合了 AI 平台數個進行中的成果,包括擷取你 AI 流量的 AI Gateway(讓你能利用自己的請求/回應資料)、作為 RL 沙盒的 Containers,以及自我們收購 Replicate 以來持續推進的 Workers AI「自帶模型」(Bring Your Own Model / Cog)工作。

今天就試試看

我們很高興今天推出 Workers AI 團隊的第一個 Cloudflare 訓練 ML 模型。我們仍在早期,還有許多改進在路上,但這是 AI 平台團隊辛勤工作的一次精彩首秀。我們相信 Clef 有潛能顛覆我們使用 agent 的方式,這也自然契合 Cloudflare 成為「agent cloud」的使命。

如果你有特定使用場景、且已是這些產品的客戶——我們很樂意在這個領域探索時與你交流,一起擔任設計合作夥伴。

試用 Workers AI 上託管的 Clef 模型,想自己探索的話可到 Hugging Face 下載權重,若有微調需求也歡迎聯絡我們。

我們的 ML 團隊影響力持續成長,從模型優化到模型訓練研究。如果你有興趣加入我們的使命,歡迎查看我們的職缺。


Hacker News 討論整理

討論串: Clef: Open-weight decision models, and new RL fine-tuning platform

分數: 410 points|留言: 157 則|發文者: jasondavies

一、整體氛圍

正面居多但審慎。多數人肯定 Cloudflare 開放權重、當天即可試用的作法;同時不少人質疑「決策模型」是不是被過度包裝的舊東西,以及 Cloudflare 宣稱的基準是否經得起第三方驗證。

二、「幾週內就做出比 Jev 更好的模型」——門檻有多低?

三、要求驗證效能數字:第三方實測與質疑

– Jev/TypeSafe:中位 230ms、平均 254ms

– Jev/OpenRouter:中位 237ms、平均 267ms

– Clef Flash:中位 661ms、平均 806ms

– 「What gives?(這怎麼回事?)」

四、官方親自回答:校準(calibration)怎麼做的

五、對 TypeSafe(Jev)的同情與商業模式質疑

六、「開源 vs 開放權重」之爭(HN 版主介入改標題)

七、「決策模型」到底是不是新東西?

八、競品與替代方案現身(含自我宣傳插曲)

九、正面與期待

十、題外但熱烈:「低垂果實」大辯論

由 Clef 是否「簡單」延伸(seizethecheese 問「列幾個剩下的低垂果實」):

十一、其他值得注意的留言

總體調性

HN 的共識大致是:Clef 本身是不錯的開放權重發布(有視覺輸入、64k 上下文、API 相容),但「決策模型」概念不新、Cloudflare 自家基準可信度存疑、第三方實測延遲與價格未必勝過 Jev。 正面評價集中在「開放權重、當天可用、刺激競爭」,負面集中在「行銷成分、基準自證、延遲數字與實測不符」。若這門生意存在護城河,多數留言者認為它在校準、資料與產品整合,而不是 I/O 形狀本身;同時也有聲音提醒,能在一個月內被抄出翻版的東西,本來就談不上太深的壁壘。


(轉譯自 Cloudflare Blog〈Introducing Clef: our open-source decision models, and new RL fine-tuning platform〉2026 年 10 月 1 日新聞稿,原文連結:https://blog.cloudflare.com/clef-decision-models/ 。Hacker News 討論串:https://news.ycombinator.com/item?id=49923692 ,網友回饋擷取截至 2026 年 10 月 2 日。)

Exit mobile version