Cloudflare加入decision model戰局,jev多一個挑戰者

譯註:Cloudflare 於 2026 年 10 月 1 日發表開源「決策模型」(decision model)Clef 與 Clef-flash,宣稱在 Typesafe Jev 自家的評測指標上領先,並同步發表強化學習微調平台。這篇翻譯全文收錄其架構與基準數字,後半整理 Hacker News 157 則討論——網友一方面肯定開放權重,另一方面質疑「決策模型」概念不新、Cloudflare 自家基準的可信度,實測延遲與價格也未必勝過 Jev。


Cloudflare Blog 原文翻譯

〈Introducing Clef: our open-source decision models, and new RL fine-tuning platform〉

Cloudflare Blog|2026 年 10 月 1 日

作者:Michelle Chen、Alex Reneau、Kevin Flansburg


過去幾週,圍繞「決策模型」(decision models)有非常多討論,例如 Typesafe AI 的 Jev System One 模型。分類模型(classifier models)雖然存在已久,但 Jev 為 AI 世界引入了新的決策模型概念——一個能便宜、快速且一致地產生有界結構化輸出的模型,當工作流程中需要做出「決斷」時就能接進去。這類模型足夠聰明,可以在任何輸入組合上運作,而不需要為了納入新的分類類別而不斷重新訓練模型。這與大型語言模型(LLM)的世界形成對比:LLM 大體上是非決定性的,但其開放性足以進行推理,並為 agentic 工作負載產生文字與工具呼叫。

今天,我們在 Workers AI 上發布兩個由 Cloudflare 訓練的決策模型:Clef 與 Clef-flash。以 Jev Decision Index 評測來看,Clef 目前是領先者,完整結果可見即時基準測試展示網站。這些模型更聰明、更快,而且完全相容 Jev API,讓你輕鬆試用這些託管模型。我們也將這些模型以 Apache 2.0 授權在 Hugging Face 上完全開源,供你本地執行與自行實驗。

最後,我們很高興首度推出全新的強化學習(RL)產品,允許客戶微調 Clef 以符合自己的使用場景。

什麼是決策模型?

決策模型進行分類,依據特定機率幫助 agent 決定該如何行動。例如,你可以傳入一則客服訊息(輸入),詢問它是否緊急、該由哪個團隊處理。決策模型會回傳帶機率的型別化答案(輸出),你的程式碼可據此路由工單、觸發升級通報,或轉交人工處理。這意味著 agentic 決策不再一定需要人類在迴圈中(human-in-the-loop)——agent 能以程式化方式蒐集脈絡、做出決策並對任務採取行動,或在需要時轉交人工。

更具體地,在 Cloudflare 內部,我們一直在測試新的 Clef 模型,協助威脅情報(Threat Intelligence)團隊對網站網域進行分類。把一個網域交給 Clef(搭配 Browser Run),它能快速辨識該網域所屬的類別——例如,它可能以 95% 的機率判定某網域是時尚網站、85% 是電商、低於 1% 是釣魚網站等。這次分類,我們的 Clef 模型花費 2.2 秒完成抓取、渲染與分類網站;相比之下,我們最快的通用 LLM gpt-oss-120b 在相同工作流程中花了 4.7 秒,而且只回傳兩個分類結果。身為使用者,你可以想像延遲減少 2 倍、結果更豐富,如何幫助我們改善威脅情報工作流程、更快識別惡意或正當網域。將此推廣到任何需要快速做出程式化決斷的場景,你就能解鎖強大的 agentic 工作流程,自主地決策、推理與執行。

在樂理中,譜號(clef)是放在五線譜開頭的符號,用來指定各線與各間的音高名稱。決策模型與樂譜號類似,因為它有助於定義脈絡的範圍,以及隨後的音符(行動)。我們選擇 Clef 作為這一系列決策模型的名稱,正是因為它有相似的用途,而其中的 CF 則呼應 Cloudflare。

Clef 與其他決策模型有何不同?

雖然市場上決策模型日益擁擠,Clef 仍有一些讓我們興奮、值得公開發布的獨特之處。第一,它有視覺編碼器(vision encoder),因此能接收圖片並分類視覺內容。這與 Jev 不同,Jev 目前只做文字分類。其次,我們的模型有 64k 上下文視窗(相較於 Jev 的 32k),讓使用者能塞進更多輸入狀態供模型分類。

第三,我們的模型準確且強大,在多項品質基準上與市場其他決策模型相比具有競爭力。我們在下方精選了若干對 Jev Decision Index 定義之「決策」重要的評測,並對市場上較熱門的模型進行評分。請看下方的基準表,或到我們的即時 decision index 展示網站查看分數:

基準測試 Clef Clef-flash Jev DiffusionGemma Jev Kev 9B Laya
BFCL · case exact 98.47 98.76 95.75 96.52 94.51 38.13
ToolRet · nDCG@10 69.19 66.43 65.28 61.21 64.26 12.69
API-Bank · accuracy 91.93 93.11 88.19 83.66 56.30 11.41
Home appliances · case exact 82.95 97.73 52.27 42.05 25.00 0.00
When2Call · accuracy 72.37 65.58 80.97 75.44 49.62 11.94
BANKING77 · macro-F1 94.20 90.93 79.74 74.28 84.83 14.29
CLINC150+OOS · macro-F1 97.43 66.77 89.27 83.49 79.03 3.19
BRIGHT · nDCG@10 45.91 39.26 47.52 42.94 38.53 19.90
Amazon ESCI · macro-F1 57.48 57.39 55.21 53.37 49.22 24.40
PhishNChips · accuracy 79.60 75.05 62.55 85.35 50.75 50.15

我們也在 Typesafe 自家的評測套件上跑了基準,Clef 系列表現良好,在 4 項領域中打贏 Jev 3 項。值得注意的是,考慮到 Clef-flash 快上許多,它的表現尤其出色:

工作流程 Clef Clef-flash Jev
發票處理 64.7 57.1 61.8
客戶服務 76.3 77 76.0
安全事件 62.9 61.7 61.7
Agent trace 觀測性 68.5 69.8 71.6

在我們執行的 43 項評測基準中,Clef 系列在延遲上擊敗其他決策模型(唯有 Laya 極快,但在上述品質基準上有所取捨):

基準測試 Clef Clef-flash Jev DiffusionGemma Jev Kev-9B Laya
中位延遲 · ms 209.3 38.8 524.1 84.4 51.4 5.8
p95 延遲 · ms 238.6 122.4 536.0 211.2 187.9 222.5

除了模型本身的延遲優勢之外,我們的 Clef 模型託管在 Workers AI 上。由於託管於 Cloudflare 基礎設施,我們能善用邊緣的 GPU,帶來低網路延遲與更快的決策。這代表你可以把 Clef 放進 agent 的熱路徑(hot path)做決策,再搭配 Workers AI 上的任一 LLM 來執行動作。


curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef} \
  -X POST \
  -H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \
  -d '{
    "model": "clef",
    "state": "Checkout has been failing for every customer for the last hour.",
    "questions": {
      "urgent": { "type": "noul", "instructions": "Is this support request urgent?" },
      "team": {
        "type": "choice",
        "instructions": "Which team should handle this request?",
        "criteria": {
          "billing": "Payments, invoices, and refunds",
          "technical": "Outages, errors, and configuration",
          "sales": "Plans and upgrades"
        }
      },
      "severity": {
        "type": "score",
        "instructions": "How severe is the customer impact?",
        "criteria": ["No impact", "Minor", "Major", "Critical"]
      }
    }
  }'

Clef 也產生與 Jev 類似的嚴格型別化輸出,且完全 API 相容,因此替換非常容易。較大的 Clef 是更強的精準模型,而 Clef-Flash 則適合延遲關鍵的決策。這些模型已達企業級,我們保證不會讀取、儲存或以你的請求與回應進行訓練(除非你想使用我們下方介紹的微調產品)。你可以今天就從開發者文件開始使用 Clef 模型,或在 Hugging Face repo 上玩玩開源模型。

如果你希望有人協助針對特定工作負載調校 Clef,我們也提供微調服務——先由前部署工程師(FDE)團隊手把手合作,之後再推出自助式微調平台,供客戶訓練並將模型重新部署到 Cloudflare。

我們如何訓練 Clef

在 Jev 推出的同一週,我們也發布了自家決策模型的一些實驗。我們的展示說明了如何改造 DiffusionGemma 模型——透過揭露 LLM 產生的 logprobs,使其輸出決定性機率。我們的初步方法建立在 Matt Mastracci 的獨立研究之上,他長期活躍於機器學習(ML)社群,分享新想法並向 vLLM 推理引擎提交 pull request,以強化 DiffusionGemma 的支援。

Clef 建立在這個概念之上,但使用了不同的基座模型作為骨幹。我們目前以 Qwen 作為基座模型,並對其進行後訓練以符合決策模型的使用場景。推理時,Clef 先用 Qwen 做一次僅預填(prefill-only)的傳遞,然後平行地對所有合法的 schema 選項打分。決策步驟是非自回歸(non-autoregressive)的,沒有逐個 token 產生的中間文字,使 Clef 明顯快於自回歸 LLM。Clef 與 Clef-flash 不是先產生中間文字再產出結構化答案,而是直接從內部骨幹表徵(backbone representations)導出 schema 選項。這種方法依賴專門的兩階段注意力路由過程:每個合法選項抽取與提示詞相關的脈絡,讓各個欄位參數能交叉注意(cross-attend)其他欄位、並在打分前回頭注意原始輸入。藉由利用詞彙先驗(lexical prior),模型在各選項之間保留語意意圖。最終,這個架構統合了選項專屬的證據路由、跨欄位聯合注意力,以及受 schema 約束的打分。

透過凍結 Qwen3.8-27B(Clef)與 Qwen3.5-9B(Clef-flash),我們對路由頭(routing head)與 rank-256 低秩適配器(LoRA)進行聯合優化。我們的後訓練對合法 schema 輸出使用標籤平滑交叉熵(label-smoothed cross-entropy),並搭配 Brier loss 來改善機率校準(probability calibration)。訓練使用我們自家的內部合成資料集,對欄位順序、提示詞與 schema 結構進行排列變化。我們還開發了「校準決策的強化學習」(RLCD, Reinforcement Learning for Calibrated Decisions)作為次要優化目標:對相鄰的序數選項給予部分學分、獎勵完全精確的記錄輸出,並施加參考懲罰以防止分佈偏移,從而帶來更好的準確度與泛化能力。

這意味著我們藉 Clef 達成了幾項新穎的成果:提升了模型在分類上的準確度;將其約束為只輸出機率而非文字生成;並使其比 Jev 與基座 Qwen 模型更快。

微調如何擴展 Clef 的能力

我們聽到很多內部場景需要微調 Clef,才能導入 Cloudflare 的 agentic 工作流程。例如,內部團隊希望有一個分類模型能評估信任與安全(Trust & Safety)提交內容、協助分類 Cloudflare 支援請求,甚至內建到我們的 Bot 產品中,判斷某個爬蟲是好機器人還是壞機器人。

這些使用場景極為特定,而我們有多年已標註的決策資料可用來訓練專用分類器。微調模型時,你可能會犧牲部分通用能力,換取特定領域的更高準確度。由於 Cloudflare 擁有橫跨多個領域、超過 15 年的網路資料,我們可以微調模型以契合這些特定場景,比通用 Clef 更準確、也更快。我們已與內部團隊合作,研究如何對 Clef 進行後訓練、打造強大的 ML 模型,以提升影響力並改善 Cloudflare 全公司的流程。這些內部團隊與使用場景正是我們新 FDE 微調團隊的下一個職責範圍,也是我們強化學習(RL)產品的基礎。

我們新的 RL 服務

我們提供一項服務,透過實戰經驗豐富的 FDE 團隊協助客戶微調 Clef 以符合其工作負載。從中,我們將汲取親手實作的經驗,打造一個自助平台,讓客戶能擷取資料、微調並重新部署模型,全程都在 Cloudflare 上完成。

這其實醞釀已久——我們一直在建構 AI 平台所需的正確原語(primitives),以便能打造自訂 RL 產品。Jev 引起的興趣顯示了市場對「快速、小型、專用分類模型」的需求,我們選擇這一點作為利基,開始實驗 RL 環境。

為此,我們利用已在 Cloudflare 平台上建好的原語:

  • Cloudflare AI Gateway – 讓所有 AI 流量通過 AI Gateway,自動為你的使用場景建立請求資料集
  • Cloudflare Workers AI – 針對基礎 Clef 模型產生 rollout
  • Cloudflare Containers – 用於評分與重放 agent 動作的 RL 沙盒
  • 【新】Trainer – 更新已微調 Clef 模型的權重
  • Cloudflare Workers AI + BYO Model – 在 Workers AI 上重新部署微調後的模型

這結合了 AI 平台數個進行中的成果,包括擷取你 AI 流量的 AI Gateway(讓你能利用自己的請求/回應資料)、作為 RL 沙盒的 Containers,以及自我們收購 Replicate 以來持續推進的 Workers AI「自帶模型」(Bring Your Own Model / Cog)工作。

今天就試試看

我們很高興今天推出 Workers AI 團隊的第一個 Cloudflare 訓練 ML 模型。我們仍在早期,還有許多改進在路上,但這是 AI 平台團隊辛勤工作的一次精彩首秀。我們相信 Clef 有潛能顛覆我們使用 agent 的方式,這也自然契合 Cloudflare 成為「agent cloud」的使命。

如果你有特定使用場景、且已是這些產品的客戶——我們很樂意在這個領域探索時與你交流,一起擔任設計合作夥伴。

試用 Workers AI 上託管的 Clef 模型,想自己探索的話可到 Hugging Face 下載權重,若有微調需求也歡迎聯絡我們。

我們的 ML 團隊影響力持續成長,從模型優化到模型訓練研究。如果你有興趣加入我們的使命,歡迎查看我們的職缺。


Hacker News 討論整理

討論串: Clef: Open-weight decision models, and new RL fine-tuning platform

分數: 410 points|留言: 157 則|發文者: jasondavies

一、整體氛圍

正面居多但審慎。多數人肯定 Cloudflare 開放權重、當天即可試用的作法;同時不少人質疑「決策模型」是不是被過度包裝的舊東西,以及 Cloudflare 宣稱的基準是否經得起第三方驗證。

二、「幾週內就做出比 Jev 更好的模型」——門檻有多低?

  • manlymuppet:「我沒聽錯吧?他們基於 Typesafe 的新典範做了決策模型,而且用 Typesafe 自己的排名來看,真的比 Jev 還好?這才過幾週。」
  • TeMPOraL(高共鳴):「這不是什麼新典範,是低垂果實,擱在那邊好幾年了;Typesafe 只是第一個停下撿起來、並大肆行銷的。但那確實就是低垂果實。」
  • calebkaiser(深度分析):一般用途分類器大家做很久了,結構化生成與受限解碼(constrained decoding)早就讓 LLM 能當通用分類器。Typesafe 真正的公告內容是:他們找到某個架構/訓練範式,做出了準確度極高、延遲極低、能超低成本推理的模型。訓練這種模型或仿作 Jev 論文描述的流程,「不超出任何實驗室的能力,不是什麼外星架構」。
  • janalsncm:「有趣的部分也是簡單的部分。模型和架構對有經驗的 ML 工程師不難。難的是資料與評估。」
  • petercooper:「小模型早就能做這類任務,只是慢一點。真正的洞見是看到 Jev 的反應後,確認市場有足夠興趣把它當獨立產品來賣。」
  • woah:「Jev 主要創新在介面、API 和產品概念。不幸的是,抄一個 API 非常容易,而且任何預訓練 LLM 都能改造成這種用法。」
  • zitterbewegung:甚至有人在 Jev 之前一年就發表過一模一樣的模型(學術性質,沒什麼行銷)。
  • fastball(反方):「說這些蠢 decision model 跟 Jev 很像,就像說 Markov chain 離 GPT-2 不遠。價值不在 I/O 形狀,而在智慧加上輸出形狀。」他認為 Jev 是第一個「感覺真的聰明」的決策模型。

三、要求驗證效能數字:第三方實測與質疑

  • segmondy(要求實測):「很多人宣稱打贏 Jev,我試過那些模型,最終都會在非平凡任務上失敗……我今晚剛下載完 Clef,會拿它跟 Jev 比非平凡任務。」他用「決策模型玩遊戲」做試金石(類似 SVG pelican bench),發現宣稱同等級的模型遊戲玩得很爛,顯示它們非常狹窄。
  • ralusek(實測打臉延遲宣稱):

– Jev/TypeSafe:中位 230ms、平均 254ms

– Jev/OpenRouter:中位 237ms、平均 267ms

– Clef Flash:中位 661ms、平均 806ms

– 「What gives?(這怎麼回事?)」

  • nikcub(n=250 mini-bench):「Clef 貴 5.2 倍、慢上許多(p50 350ms vs 1.9s),結果只略好(78.6% vs 79.8%)。」(註:該留言原文的毫秒數與「誰慢」的文字敘述互相矛盾,此處照錄原文數字。)
  • alex7o:「我兩小時前試了,在 Cloudflare 上測 Jev,想說這應該是更好的替代品,結果它要 3 秒,對我毫無用處。」
  • vulture916(價格換算):Jev $0.042/M 輸入(輸出免費)、Clef $0.24/M 輸入。每次 300 token 計算:100 萬次決策 Jev 約 $12.60,Clef 約 $72。「如果有能力自己託管 Clef 還合理;不然……」
  • ssiddharth:Clef $0.24/M 約是 Jev 的 6 倍;Clef-flash $0.09 才比較有競爭力。
  • CBLT:「他們的 Pareto 前沿居然沒把成本畫進去,很奇怪。」
  • SebastianSosa:「公開基準很容易作弊。如果我是 Typesafe,我也會放一個公開基準,讓有能力的人去過擬合(overfit)基準,而不是做真正有用的東西。」
  • verdverm:Jev 玩寶可夢也露了餡——「想要藥水→你確定嗎→不要→循環;室內室外來回鬼打牆」,雖然花不到 2 美元通關,但「 hype 多於實料」。

四、官方親自回答:校準(calibration)怎麼做的

  • zwaps:「沒提到 calibration,就是另一個 LLM finetune 嗎?」
  • kflansburg(Cloudflare 員工,模型作者之一)親自回覆:「我們的後訓練對合法 schema 輸出使用標籤平滑交叉熵(label-smoothed cross-entropy),並搭配 Brier loss 來改善機率校準。」
  • porridgeraisin:「校準好不好的意見眾說紛紜(包括我自己的)。Jev 似乎最好。但 Jev 的發布讓這類模型的 PMF 顯而易見——當你取代的原本是拿 LM head softmax 機率(根本沒校準)的場景時,校準其實不太重要。大家大多只在意準確度,不在意信心度。」
  • sheepscreek:「Jev 較有趣的特徵之一是幾乎沒人討論的 confidence rating。」
  • amluto(深度批評):「除非你能微調它,否則 Jev 這種模型沒特別有用。Jev API 完全無法傳入先驗(prior),既不能傳先驗又不能微調,你得到的輸出可能幾乎毫無意義。」他引官方文件「Confidence is derived from the probabilities」,並吐槽「為什麼找到引用這句的 AI slop 網站比找到正式文件容易?」

五、對 TypeSafe(Jev)的同情與商業模式質疑

  • MisterMunchkin:「想像你把整家公司押在一個模型上,然後一週內被所有人超車。我沒見過這種事。」
  • RGS1811:「如果別人不到一個月就能做出你的產品的翻版,那你的產品本身可能沒什麼護城河。」
  • hansonkd(商業悖論):「這些 AI 公司有個奇怪的悖論——如果他們真的有一個超高效、能套利其他模型的模型,他們會把一切都保密。為了彌補模型經濟上的不可行,他們被迫公開發布、靠行銷讓別人為了 hype 付錢。」
  • esafak:「我有點同情 Jev 那幫人,不知道他們有沒有預料到這麼多競爭?」
  • wakeywakeywakey(酸):「Jev 可以問問 Jev 自己該不該把投資人的錢退一退然後關門。」

六、「開源 vs 開放權重」之爭(HN 版主介入改標題)

  • buildbuildbuild:「是 open weights,不是 open source。權重授權寬鬆,但資料與訓練管線未公開,無法從他們的專有 Qwen 起點重現。權重不是『原始碼』。」
  • dang(HN 版主):「OK,我們已經把標題的 source 改成 weights 了——至少在有人來跟我說這也不對之前!」

七、「決策模型」到底是不是新東西?

  • smallmancontrov(幽默):「我完全支持把判別式模型重新品牌化為決策模型……『Discriminative』一直以來形象就爛,當我看到知名 ML 研究者開始把 discriminative 描述成 generative 時我就知道完了。『Decision model』把價值主張賣得好多了。」
  • alightsoul:「那就是 decision tree、random forest 或其他 ML 分類器,存在很久了。」
  • orbital-decay:「『決策模型』跟 OpenAI 當年推『LRM』是同一路數的行銷。本質上還是用於決策的分類器。」
  • sigbottle:「這些新『決策模型』到底是什麼?拿現成 LLM、餵 prompt、逼它選一個;解碼就 1 個 token……就這樣?」→ redox99:「是的,但如果你要機率真的有意義,你需要校準模型。」
  • meander_water(反駁官方文案):「文章說 LLM『大體非決定性』來對比決策模型,這有誤導性。決策模型也不產生決定性輸出,重複呼叫可能做出不同決策,跟用結構化輸出的 LLM 一樣。」
  • cakoose(質疑「人類不必在迴圈中」):「1. 很多 LLM agent 動作本來就沒人類在迴圈,這只是信任度問題不是新典範。2. 如果它只輸出單一決策,怎麼蒐集脈絡?」
  • ranyume(質疑行銷文案邏輯):「他們那段關於擁有多少網路資料的段落很怪。既然你早就有這些資料,為什麼不早點拿去訓練?為什麼需要 Clef?」

八、競品與替代方案現身(含自我宣傳插曲)

  • okpatil(At0m,明顯推銷):主打 60M 參數、16ms 延遲、本地執行的「本地 Jev」,多處貼同一篇連結。kamranjon 指出「這帳號幾週前才創立、一直在推這個閉源模型,可能是 bot?」(okpatil 回應帳號其實 12 年前就創了)。sheepscreek 批評他「推銷前先真心推進討論」;afzalive 指出「那個模型根本還沒發布」。
  • handfuloflight → croemer:推薦開源 Laya(github.com/NandhaKishorM/laya),croemer 回報「本地裝起來能用了!」
  • mrkn1:推薦 CPU 上跑的小型決策模型討論串。

九、正面與期待

  • damsta:「這個領域有競爭很棒,kudos 給可以當天試用的發布。」
  • schainks:「AMAZING, thanks, Cloudflare!」
  • swingboy:「支援圖片輸入,讚!」→ ttul 推測這是他們內部要給模型看電子郵件與網頁截圖來偵測釣魚(儘管 HTML 被混淆)。
  • johnecheck:「Cloudflare 一直在買走我的好感。持續推出有趣的新東西,產品紮實價格合理,幾乎好到不像真的。」
  • gitghxst:「我相信未來幾個月決策導向的模型會爆發。」
  • fooker:「我打賭競爭會帶來如何讓這類模型再快幾個數量級、再便宜幾個數量級的研究。挑戰題:給一個 1M 上下文視窗,在 50–100ms 內產出 N 個決策。」
  • 6thbit(好點子):「好的應用場景可能是 Cloudflare 自己的 WAF 規則——給 decider 更廣的請求脈絡,讓它直接挑戰類型/封鎖流量。不過現在可能太貴了。」

十、題外但熱烈:「低垂果實」大辯論

由 Clef 是否「簡單」延伸(seizethecheese 問「列幾個剩下的低垂果實」):

  • TeMPOraL:Jev 是一個;diffusion transformers 不算「簡單」但資金不足;還有「讓 GPT-4 級 LLM 在邊緣硬體上跑每秒數百 token」(拼字檢查、作業系統即時猜你想幹嘛之類的應用);以及好好資助「把模型當計算產物研究」——潛空間怎麼形成、內部怎麼建模世界。
  • bpht:關鍵是合成數據——現在我們有能免費產生大規模完美標註多模態數據的預言機(oracle);過去 40 年的每一種架構都會突然出現大躍進。
  • Twirrim:已有客製 ASIC 跑 Llama 3.1 8B 達 17,000 tokens/s(Taalas 的 Chat Jimmy),「速度快到反而成問題——回覆好幾段我得慢慢消化。我們不一定總是需要更新更快更強的模型,『夠用』空間很大。」
  • CamperBob2:用新主機剛推出時的遊戲 vs 生命末期的遊戲做比喻——我們對現有 LLM 組件的榨取還遠未到極限,就算沒有任何新方法,也夠研究十年。
  • ekabod:「(透明度/智能理論)那是高掛的果實,不是低垂的。」

十一、其他值得注意的留言

  • 基座模型更正:原評論說 Clef-flash 基於 Qwen3.8-9B,NitpickLawyer 指出官方 model card 寫的是 Qwen3.5-9B(部落格內文亦為 Qwen3.5-9B、Clef 為 Qwen3.8-27B),原留言已更正。
  • swe_dima:「希望能看到視覺任務的基準。」
  • winddude:「現在就缺新的 NER 模型了。」
  • radium3d:問這類決策模型能否用來強化電玩 NPC 的 AI。
  • cakoose / open592(「2 years in stealth…」) 等較短留言亦為討論串一部分。

總體調性

HN 的共識大致是:Clef 本身是不錯的開放權重發布(有視覺輸入、64k 上下文、API 相容),但「決策模型」概念不新、Cloudflare 自家基準可信度存疑、第三方實測延遲與價格未必勝過 Jev。 正面評價集中在「開放權重、當天可用、刺激競爭」,負面集中在「行銷成分、基準自證、延遲數字與實測不符」。若這門生意存在護城河,多數留言者認為它在校準、資料與產品整合,而不是 I/O 形狀本身;同時也有聲音提醒,能在一個月內被抄出翻版的東西,本來就談不上太深的壁壘。


(轉譯自 Cloudflare Blog〈Introducing Clef: our open-source decision models, and new RL fine-tuning platform〉2026 年 10 月 1 日新聞稿,原文連結:https://blog.cloudflare.com/clef-decision-models/ 。Hacker News 討論串:https://news.ycombinator.com/item?id=49923692 ,網友回饋擷取截至 2026 年 10 月 2 日。)

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *