譯註:Cloudflare 於 2026 年 10 月 1 日發表開源「決策模型」(decision model)Clef 與 Clef-flash,宣稱在 Typesafe Jev 自家的評測指標上領先,並同步發表強化學習微調平台。這篇翻譯全文收錄其架構與基準數字,後半整理 Hacker News 157 則討論——網友一方面肯定開放權重,另一方面質疑「決策模型」概念不新、Cloudflare 自家基準的可信度,實測延遲與價格也未必勝過 Jev。
Cloudflare Blog 原文翻譯
〈Introducing Clef: our open-source decision models, and new RL fine-tuning platform〉
Cloudflare Blog|2026 年 10 月 1 日
作者:Michelle Chen、Alex Reneau、Kevin Flansburg
過去幾週,圍繞「決策模型」(decision models)有非常多討論,例如 Typesafe AI 的 Jev System One 模型。分類模型(classifier models)雖然存在已久,但 Jev 為 AI 世界引入了新的決策模型概念——一個能便宜、快速且一致地產生有界結構化輸出的模型,當工作流程中需要做出「決斷」時就能接進去。這類模型足夠聰明,可以在任何輸入組合上運作,而不需要為了納入新的分類類別而不斷重新訓練模型。這與大型語言模型(LLM)的世界形成對比:LLM 大體上是非決定性的,但其開放性足以進行推理,並為 agentic 工作負載產生文字與工具呼叫。
今天,我們在 Workers AI 上發布兩個由 Cloudflare 訓練的決策模型:Clef 與 Clef-flash。以 Jev Decision Index 評測來看,Clef 目前是領先者,完整結果可見即時基準測試展示網站。這些模型更聰明、更快,而且完全相容 Jev API,讓你輕鬆試用這些託管模型。我們也將這些模型以 Apache 2.0 授權在 Hugging Face 上完全開源,供你本地執行與自行實驗。
最後,我們很高興首度推出全新的強化學習(RL)產品,允許客戶微調 Clef 以符合自己的使用場景。
什麼是決策模型?
決策模型進行分類,依據特定機率幫助 agent 決定該如何行動。例如,你可以傳入一則客服訊息(輸入),詢問它是否緊急、該由哪個團隊處理。決策模型會回傳帶機率的型別化答案(輸出),你的程式碼可據此路由工單、觸發升級通報,或轉交人工處理。這意味著 agentic 決策不再一定需要人類在迴圈中(human-in-the-loop)——agent 能以程式化方式蒐集脈絡、做出決策並對任務採取行動,或在需要時轉交人工。
更具體地,在 Cloudflare 內部,我們一直在測試新的 Clef 模型,協助威脅情報(Threat Intelligence)團隊對網站網域進行分類。把一個網域交給 Clef(搭配 Browser Run),它能快速辨識該網域所屬的類別——例如,它可能以 95% 的機率判定某網域是時尚網站、85% 是電商、低於 1% 是釣魚網站等。這次分類,我們的 Clef 模型花費 2.2 秒完成抓取、渲染與分類網站;相比之下,我們最快的通用 LLM gpt-oss-120b 在相同工作流程中花了 4.7 秒,而且只回傳兩個分類結果。身為使用者,你可以想像延遲減少 2 倍、結果更豐富,如何幫助我們改善威脅情報工作流程、更快識別惡意或正當網域。將此推廣到任何需要快速做出程式化決斷的場景,你就能解鎖強大的 agentic 工作流程,自主地決策、推理與執行。
在樂理中,譜號(clef)是放在五線譜開頭的符號,用來指定各線與各間的音高名稱。決策模型與樂譜號類似,因為它有助於定義脈絡的範圍,以及隨後的音符(行動)。我們選擇 Clef 作為這一系列決策模型的名稱,正是因為它有相似的用途,而其中的 CF 則呼應 Cloudflare。
Clef 與其他決策模型有何不同?
雖然市場上決策模型日益擁擠,Clef 仍有一些讓我們興奮、值得公開發布的獨特之處。第一,它有視覺編碼器(vision encoder),因此能接收圖片並分類視覺內容。這與 Jev 不同,Jev 目前只做文字分類。其次,我們的模型有 64k 上下文視窗(相較於 Jev 的 32k),讓使用者能塞進更多輸入狀態供模型分類。
第三,我們的模型準確且強大,在多項品質基準上與市場其他決策模型相比具有競爭力。我們在下方精選了若干對 Jev Decision Index 定義之「決策」重要的評測,並對市場上較熱門的模型進行評分。請看下方的基準表,或到我們的即時 decision index 展示網站查看分數:
| 基準測試 | Clef | Clef-flash | Jev | DiffusionGemma Jev | Kev 9B | Laya |
|---|---|---|---|---|---|---|
| BFCL · case exact | 98.47 | 98.76 | 95.75 | 96.52 | 94.51 | 38.13 |
| ToolRet · nDCG@10 | 69.19 | 66.43 | 65.28 | 61.21 | 64.26 | 12.69 |
| API-Bank · accuracy | 91.93 | 93.11 | 88.19 | 83.66 | 56.30 | 11.41 |
| Home appliances · case exact | 82.95 | 97.73 | 52.27 | 42.05 | 25.00 | 0.00 |
| When2Call · accuracy | 72.37 | 65.58 | 80.97 | 75.44 | 49.62 | 11.94 |
| BANKING77 · macro-F1 | 94.20 | 90.93 | 79.74 | 74.28 | 84.83 | 14.29 |
| CLINC150+OOS · macro-F1 | 97.43 | 66.77 | 89.27 | 83.49 | 79.03 | 3.19 |
| BRIGHT · nDCG@10 | 45.91 | 39.26 | 47.52 | 42.94 | 38.53 | 19.90 |
| Amazon ESCI · macro-F1 | 57.48 | 57.39 | 55.21 | 53.37 | 49.22 | 24.40 |
| PhishNChips · accuracy | 79.60 | 75.05 | 62.55 | 85.35 | 50.75 | 50.15 |
我們也在 Typesafe 自家的評測套件上跑了基準,Clef 系列表現良好,在 4 項領域中打贏 Jev 3 項。值得注意的是,考慮到 Clef-flash 快上許多,它的表現尤其出色:
| 工作流程 | Clef | Clef-flash | Jev |
|---|---|---|---|
| 發票處理 | 64.7 | 57.1 | 61.8 |
| 客戶服務 | 76.3 | 77 | 76.0 |
| 安全事件 | 62.9 | 61.7 | 61.7 |
| Agent trace 觀測性 | 68.5 | 69.8 | 71.6 |
在我們執行的 43 項評測基準中,Clef 系列在延遲上擊敗其他決策模型(唯有 Laya 極快,但在上述品質基準上有所取捨):
| 基準測試 | Clef | Clef-flash | Jev | DiffusionGemma Jev | Kev-9B | Laya |
|---|---|---|---|---|---|---|
| 中位延遲 · ms | 209.3 | 38.8 | 524.1 | 84.4 | 51.4 | 5.8 |
| p95 延遲 · ms | 238.6 | 122.4 | 536.0 | 211.2 | 187.9 | 222.5 |
除了模型本身的延遲優勢之外,我們的 Clef 模型託管在 Workers AI 上。由於託管於 Cloudflare 基礎設施,我們能善用邊緣的 GPU,帶來低網路延遲與更快的決策。這代表你可以把 Clef 放進 agent 的熱路徑(hot path)做決策,再搭配 Workers AI 上的任一 LLM 來執行動作。
curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef} \
-X POST \
-H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \
-d '{
"model": "clef",
"state": "Checkout has been failing for every customer for the last hour.",
"questions": {
"urgent": { "type": "noul", "instructions": "Is this support request urgent?" },
"team": {
"type": "choice",
"instructions": "Which team should handle this request?",
"criteria": {
"billing": "Payments, invoices, and refunds",
"technical": "Outages, errors, and configuration",
"sales": "Plans and upgrades"
}
},
"severity": {
"type": "score",
"instructions": "How severe is the customer impact?",
"criteria": ["No impact", "Minor", "Major", "Critical"]
}
}
}'
Clef 也產生與 Jev 類似的嚴格型別化輸出,且完全 API 相容,因此替換非常容易。較大的 Clef 是更強的精準模型,而 Clef-Flash 則適合延遲關鍵的決策。這些模型已達企業級,我們保證不會讀取、儲存或以你的請求與回應進行訓練(除非你想使用我們下方介紹的微調產品)。你可以今天就從開發者文件開始使用 Clef 模型,或在 Hugging Face repo 上玩玩開源模型。
如果你希望有人協助針對特定工作負載調校 Clef,我們也提供微調服務——先由前部署工程師(FDE)團隊手把手合作,之後再推出自助式微調平台,供客戶訓練並將模型重新部署到 Cloudflare。
我們如何訓練 Clef
在 Jev 推出的同一週,我們也發布了自家決策模型的一些實驗。我們的展示說明了如何改造 DiffusionGemma 模型——透過揭露 LLM 產生的 logprobs,使其輸出決定性機率。我們的初步方法建立在 Matt Mastracci 的獨立研究之上,他長期活躍於機器學習(ML)社群,分享新想法並向 vLLM 推理引擎提交 pull request,以強化 DiffusionGemma 的支援。
Clef 建立在這個概念之上,但使用了不同的基座模型作為骨幹。我們目前以 Qwen 作為基座模型,並對其進行後訓練以符合決策模型的使用場景。推理時,Clef 先用 Qwen 做一次僅預填(prefill-only)的傳遞,然後平行地對所有合法的 schema 選項打分。決策步驟是非自回歸(non-autoregressive)的,沒有逐個 token 產生的中間文字,使 Clef 明顯快於自回歸 LLM。Clef 與 Clef-flash 不是先產生中間文字再產出結構化答案,而是直接從內部骨幹表徵(backbone representations)導出 schema 選項。這種方法依賴專門的兩階段注意力路由過程:每個合法選項抽取與提示詞相關的脈絡,讓各個欄位參數能交叉注意(cross-attend)其他欄位、並在打分前回頭注意原始輸入。藉由利用詞彙先驗(lexical prior),模型在各選項之間保留語意意圖。最終,這個架構統合了選項專屬的證據路由、跨欄位聯合注意力,以及受 schema 約束的打分。
透過凍結 Qwen3.8-27B(Clef)與 Qwen3.5-9B(Clef-flash),我們對路由頭(routing head)與 rank-256 低秩適配器(LoRA)進行聯合優化。我們的後訓練對合法 schema 輸出使用標籤平滑交叉熵(label-smoothed cross-entropy),並搭配 Brier loss 來改善機率校準(probability calibration)。訓練使用我們自家的內部合成資料集,對欄位順序、提示詞與 schema 結構進行排列變化。我們還開發了「校準決策的強化學習」(RLCD, Reinforcement Learning for Calibrated Decisions)作為次要優化目標:對相鄰的序數選項給予部分學分、獎勵完全精確的記錄輸出,並施加參考懲罰以防止分佈偏移,從而帶來更好的準確度與泛化能力。
這意味著我們藉 Clef 達成了幾項新穎的成果:提升了模型在分類上的準確度;將其約束為只輸出機率而非文字生成;並使其比 Jev 與基座 Qwen 模型更快。
微調如何擴展 Clef 的能力
我們聽到很多內部場景需要微調 Clef,才能導入 Cloudflare 的 agentic 工作流程。例如,內部團隊希望有一個分類模型能評估信任與安全(Trust & Safety)提交內容、協助分類 Cloudflare 支援請求,甚至內建到我們的 Bot 產品中,判斷某個爬蟲是好機器人還是壞機器人。
這些使用場景極為特定,而我們有多年已標註的決策資料可用來訓練專用分類器。微調模型時,你可能會犧牲部分通用能力,換取特定領域的更高準確度。由於 Cloudflare 擁有橫跨多個領域、超過 15 年的網路資料,我們可以微調模型以契合這些特定場景,比通用 Clef 更準確、也更快。我們已與內部團隊合作,研究如何對 Clef 進行後訓練、打造強大的 ML 模型,以提升影響力並改善 Cloudflare 全公司的流程。這些內部團隊與使用場景正是我們新 FDE 微調團隊的下一個職責範圍,也是我們強化學習(RL)產品的基礎。
我們新的 RL 服務
我們提供一項服務,透過實戰經驗豐富的 FDE 團隊協助客戶微調 Clef 以符合其工作負載。從中,我們將汲取親手實作的經驗,打造一個自助平台,讓客戶能擷取資料、微調並重新部署模型,全程都在 Cloudflare 上完成。
這其實醞釀已久——我們一直在建構 AI 平台所需的正確原語(primitives),以便能打造自訂 RL 產品。Jev 引起的興趣顯示了市場對「快速、小型、專用分類模型」的需求,我們選擇這一點作為利基,開始實驗 RL 環境。
為此,我們利用已在 Cloudflare 平台上建好的原語:
- Cloudflare AI Gateway – 讓所有 AI 流量通過 AI Gateway,自動為你的使用場景建立請求資料集
- Cloudflare Workers AI – 針對基礎 Clef 模型產生 rollout
- Cloudflare Containers – 用於評分與重放 agent 動作的 RL 沙盒
- 【新】Trainer – 更新已微調 Clef 模型的權重
- Cloudflare Workers AI + BYO Model – 在 Workers AI 上重新部署微調後的模型
這結合了 AI 平台數個進行中的成果,包括擷取你 AI 流量的 AI Gateway(讓你能利用自己的請求/回應資料)、作為 RL 沙盒的 Containers,以及自我們收購 Replicate 以來持續推進的 Workers AI「自帶模型」(Bring Your Own Model / Cog)工作。
今天就試試看
我們很高興今天推出 Workers AI 團隊的第一個 Cloudflare 訓練 ML 模型。我們仍在早期,還有許多改進在路上,但這是 AI 平台團隊辛勤工作的一次精彩首秀。我們相信 Clef 有潛能顛覆我們使用 agent 的方式,這也自然契合 Cloudflare 成為「agent cloud」的使命。
如果你有特定使用場景、且已是這些產品的客戶——我們很樂意在這個領域探索時與你交流,一起擔任設計合作夥伴。
試用 Workers AI 上託管的 Clef 模型,想自己探索的話可到 Hugging Face 下載權重,若有微調需求也歡迎聯絡我們。
我們的 ML 團隊影響力持續成長,從模型優化到模型訓練研究。如果你有興趣加入我們的使命,歡迎查看我們的職缺。
Hacker News 討論整理
討論串: Clef: Open-weight decision models, and new RL fine-tuning platform
分數: 410 points|留言: 157 則|發文者: jasondavies
一、整體氛圍
正面居多但審慎。多數人肯定 Cloudflare 開放權重、當天即可試用的作法;同時不少人質疑「決策模型」是不是被過度包裝的舊東西,以及 Cloudflare 宣稱的基準是否經得起第三方驗證。
二、「幾週內就做出比 Jev 更好的模型」——門檻有多低?
- manlymuppet:「我沒聽錯吧?他們基於 Typesafe 的新典範做了決策模型,而且用 Typesafe 自己的排名來看,真的比 Jev 還好?這才過幾週。」
- TeMPOraL(高共鳴):「這不是什麼新典範,是低垂果實,擱在那邊好幾年了;Typesafe 只是第一個停下撿起來、並大肆行銷的。但那確實就是低垂果實。」
- calebkaiser(深度分析):一般用途分類器大家做很久了,結構化生成與受限解碼(constrained decoding)早就讓 LLM 能當通用分類器。Typesafe 真正的公告內容是:他們找到某個架構/訓練範式,做出了準確度極高、延遲極低、能超低成本推理的模型。訓練這種模型或仿作 Jev 論文描述的流程,「不超出任何實驗室的能力,不是什麼外星架構」。
- janalsncm:「有趣的部分也是簡單的部分。模型和架構對有經驗的 ML 工程師不難。難的是資料與評估。」
- petercooper:「小模型早就能做這類任務,只是慢一點。真正的洞見是看到 Jev 的反應後,確認市場有足夠興趣把它當獨立產品來賣。」
- woah:「Jev 主要創新在介面、API 和產品概念。不幸的是,抄一個 API 非常容易,而且任何預訓練 LLM 都能改造成這種用法。」
- zitterbewegung:甚至有人在 Jev 之前一年就發表過一模一樣的模型(學術性質,沒什麼行銷)。
- fastball(反方):「說這些蠢 decision model 跟 Jev 很像,就像說 Markov chain 離 GPT-2 不遠。價值不在 I/O 形狀,而在智慧加上輸出形狀。」他認為 Jev 是第一個「感覺真的聰明」的決策模型。
三、要求驗證效能數字:第三方實測與質疑
- segmondy(要求實測):「很多人宣稱打贏 Jev,我試過那些模型,最終都會在非平凡任務上失敗……我今晚剛下載完 Clef,會拿它跟 Jev 比非平凡任務。」他用「決策模型玩遊戲」做試金石(類似 SVG pelican bench),發現宣稱同等級的模型遊戲玩得很爛,顯示它們非常狹窄。
- ralusek(實測打臉延遲宣稱):
– Jev/TypeSafe:中位 230ms、平均 254ms
– Jev/OpenRouter:中位 237ms、平均 267ms
– Clef Flash:中位 661ms、平均 806ms
– 「What gives?(這怎麼回事?)」
- nikcub(n=250 mini-bench):「Clef 貴 5.2 倍、慢上許多(p50 350ms vs 1.9s),結果只略好(78.6% vs 79.8%)。」(註:該留言原文的毫秒數與「誰慢」的文字敘述互相矛盾,此處照錄原文數字。)
- alex7o:「我兩小時前試了,在 Cloudflare 上測 Jev,想說這應該是更好的替代品,結果它要 3 秒,對我毫無用處。」
- vulture916(價格換算):Jev $0.042/M 輸入(輸出免費)、Clef $0.24/M 輸入。每次 300 token 計算:100 萬次決策 Jev 約 $12.60,Clef 約 $72。「如果有能力自己託管 Clef 還合理;不然……」
- ssiddharth:Clef $0.24/M 約是 Jev 的 6 倍;Clef-flash $0.09 才比較有競爭力。
- CBLT:「他們的 Pareto 前沿居然沒把成本畫進去,很奇怪。」
- SebastianSosa:「公開基準很容易作弊。如果我是 Typesafe,我也會放一個公開基準,讓有能力的人去過擬合(overfit)基準,而不是做真正有用的東西。」
- verdverm:Jev 玩寶可夢也露了餡——「想要藥水→你確定嗎→不要→循環;室內室外來回鬼打牆」,雖然花不到 2 美元通關,但「 hype 多於實料」。
四、官方親自回答:校準(calibration)怎麼做的
- zwaps:「沒提到 calibration,就是另一個 LLM finetune 嗎?」
- kflansburg(Cloudflare 員工,模型作者之一)親自回覆:「我們的後訓練對合法 schema 輸出使用標籤平滑交叉熵(label-smoothed cross-entropy),並搭配 Brier loss 來改善機率校準。」
- porridgeraisin:「校準好不好的意見眾說紛紜(包括我自己的)。Jev 似乎最好。但 Jev 的發布讓這類模型的 PMF 顯而易見——當你取代的原本是拿 LM head softmax 機率(根本沒校準)的場景時,校準其實不太重要。大家大多只在意準確度,不在意信心度。」
- sheepscreek:「Jev 較有趣的特徵之一是幾乎沒人討論的 confidence rating。」
- amluto(深度批評):「除非你能微調它,否則 Jev 這種模型沒特別有用。Jev API 完全無法傳入先驗(prior),既不能傳先驗又不能微調,你得到的輸出可能幾乎毫無意義。」他引官方文件「Confidence is derived from the probabilities」,並吐槽「為什麼找到引用這句的 AI slop 網站比找到正式文件容易?」
五、對 TypeSafe(Jev)的同情與商業模式質疑
- MisterMunchkin:「想像你把整家公司押在一個模型上,然後一週內被所有人超車。我沒見過這種事。」
- RGS1811:「如果別人不到一個月就能做出你的產品的翻版,那你的產品本身可能沒什麼護城河。」
- hansonkd(商業悖論):「這些 AI 公司有個奇怪的悖論——如果他們真的有一個超高效、能套利其他模型的模型,他們會把一切都保密。為了彌補模型經濟上的不可行,他們被迫公開發布、靠行銷讓別人為了 hype 付錢。」
- esafak:「我有點同情 Jev 那幫人,不知道他們有沒有預料到這麼多競爭?」
- wakeywakeywakey(酸):「Jev 可以問問 Jev 自己該不該把投資人的錢退一退然後關門。」
六、「開源 vs 開放權重」之爭(HN 版主介入改標題)
- buildbuildbuild:「是 open weights,不是 open source。權重授權寬鬆,但資料與訓練管線未公開,無法從他們的專有 Qwen 起點重現。權重不是『原始碼』。」
- dang(HN 版主):「OK,我們已經把標題的 source 改成 weights 了——至少在有人來跟我說這也不對之前!」
七、「決策模型」到底是不是新東西?
- smallmancontrov(幽默):「我完全支持把判別式模型重新品牌化為決策模型……『Discriminative』一直以來形象就爛,當我看到知名 ML 研究者開始把 discriminative 描述成 generative 時我就知道完了。『Decision model』把價值主張賣得好多了。」
- alightsoul:「那就是 decision tree、random forest 或其他 ML 分類器,存在很久了。」
- orbital-decay:「『決策模型』跟 OpenAI 當年推『LRM』是同一路數的行銷。本質上還是用於決策的分類器。」
- sigbottle:「這些新『決策模型』到底是什麼?拿現成 LLM、餵 prompt、逼它選一個;解碼就 1 個 token……就這樣?」→ redox99:「是的,但如果你要機率真的有意義,你需要校準模型。」
- meander_water(反駁官方文案):「文章說 LLM『大體非決定性』來對比決策模型,這有誤導性。決策模型也不產生決定性輸出,重複呼叫可能做出不同決策,跟用結構化輸出的 LLM 一樣。」
- cakoose(質疑「人類不必在迴圈中」):「1. 很多 LLM agent 動作本來就沒人類在迴圈,這只是信任度問題不是新典範。2. 如果它只輸出單一決策,怎麼蒐集脈絡?」
- ranyume(質疑行銷文案邏輯):「他們那段關於擁有多少網路資料的段落很怪。既然你早就有這些資料,為什麼不早點拿去訓練?為什麼需要 Clef?」
八、競品與替代方案現身(含自我宣傳插曲)
- okpatil(At0m,明顯推銷):主打 60M 參數、16ms 延遲、本地執行的「本地 Jev」,多處貼同一篇連結。kamranjon 指出「這帳號幾週前才創立、一直在推這個閉源模型,可能是 bot?」(okpatil 回應帳號其實 12 年前就創了)。sheepscreek 批評他「推銷前先真心推進討論」;afzalive 指出「那個模型根本還沒發布」。
- handfuloflight → croemer:推薦開源 Laya(github.com/NandhaKishorM/laya),croemer 回報「本地裝起來能用了!」
- mrkn1:推薦 CPU 上跑的小型決策模型討論串。
九、正面與期待
- damsta:「這個領域有競爭很棒,kudos 給可以當天試用的發布。」
- schainks:「AMAZING, thanks, Cloudflare!」
- swingboy:「支援圖片輸入,讚!」→ ttul 推測這是他們內部要給模型看電子郵件與網頁截圖來偵測釣魚(儘管 HTML 被混淆)。
- johnecheck:「Cloudflare 一直在買走我的好感。持續推出有趣的新東西,產品紮實價格合理,幾乎好到不像真的。」
- gitghxst:「我相信未來幾個月決策導向的模型會爆發。」
- fooker:「我打賭競爭會帶來如何讓這類模型再快幾個數量級、再便宜幾個數量級的研究。挑戰題:給一個 1M 上下文視窗,在 50–100ms 內產出 N 個決策。」
- 6thbit(好點子):「好的應用場景可能是 Cloudflare 自己的 WAF 規則——給 decider 更廣的請求脈絡,讓它直接挑戰類型/封鎖流量。不過現在可能太貴了。」
十、題外但熱烈:「低垂果實」大辯論
由 Clef 是否「簡單」延伸(seizethecheese 問「列幾個剩下的低垂果實」):
- TeMPOraL:Jev 是一個;diffusion transformers 不算「簡單」但資金不足;還有「讓 GPT-4 級 LLM 在邊緣硬體上跑每秒數百 token」(拼字檢查、作業系統即時猜你想幹嘛之類的應用);以及好好資助「把模型當計算產物研究」——潛空間怎麼形成、內部怎麼建模世界。
- bpht:關鍵是合成數據——現在我們有能免費產生大規模完美標註多模態數據的預言機(oracle);過去 40 年的每一種架構都會突然出現大躍進。
- Twirrim:已有客製 ASIC 跑 Llama 3.1 8B 達 17,000 tokens/s(Taalas 的 Chat Jimmy),「速度快到反而成問題——回覆好幾段我得慢慢消化。我們不一定總是需要更新更快更強的模型,『夠用』空間很大。」
- CamperBob2:用新主機剛推出時的遊戲 vs 生命末期的遊戲做比喻——我們對現有 LLM 組件的榨取還遠未到極限,就算沒有任何新方法,也夠研究十年。
- ekabod:「(透明度/智能理論)那是高掛的果實,不是低垂的。」
十一、其他值得注意的留言
- 基座模型更正:原評論說 Clef-flash 基於 Qwen3.8-9B,NitpickLawyer 指出官方 model card 寫的是 Qwen3.5-9B(部落格內文亦為 Qwen3.5-9B、Clef 為 Qwen3.8-27B),原留言已更正。
- swe_dima:「希望能看到視覺任務的基準。」
- winddude:「現在就缺新的 NER 模型了。」
- radium3d:問這類決策模型能否用來強化電玩 NPC 的 AI。
- cakoose / open592(「2 years in stealth…」) 等較短留言亦為討論串一部分。
總體調性
HN 的共識大致是:Clef 本身是不錯的開放權重發布(有視覺輸入、64k 上下文、API 相容),但「決策模型」概念不新、Cloudflare 自家基準可信度存疑、第三方實測延遲與價格未必勝過 Jev。 正面評價集中在「開放權重、當天可用、刺激競爭」,負面集中在「行銷成分、基準自證、延遲數字與實測不符」。若這門生意存在護城河,多數留言者認為它在校準、資料與產品整合,而不是 I/O 形狀本身;同時也有聲音提醒,能在一個月內被抄出翻版的東西,本來就談不上太深的壁壘。
(轉譯自 Cloudflare Blog〈Introducing Clef: our open-source decision models, and new RL fine-tuning platform〉2026 年 10 月 1 日新聞稿,原文連結:https://blog.cloudflare.com/clef-decision-models/ 。Hacker News 討論串:https://news.ycombinator.com/item?id=49923692 ,網友回饋擷取截至 2026 年 10 月 2 日。)
