TypeSafe Jev 生態系一週觀察:決策模型、開源復刻與展示聚落

Jev 不寫字,只做判斷。一週內第三方評測、開源復刻與展示聚落全部出現,這篇把評測數字、復刻對照表與展示案例展開,只寫可驗證的部分。

TypeSafe Jev 生態系一週觀察:決策模型、開源復刻與展示聚落

TypeSafe AI 在九月中旬公開第一個 System One 模型 Jev。它的訴求很窄:不寫字,只對事先定義好的選項做判斷,並附上信心值。一週之內,圍繞它的第三方評測、開源復刻與展示作品全部出現。這篇把研究筆記裡可驗證的部分展開,數字與出處都保留。

Jev 是什麼

Jev 是一個閉源 API 模型,沒有公開權重,沒有論文。呼叫方式是送出一段狀態描述,加上幾個事先定義好的問題,拿回型別固定的答案。問題只有三種:單選(最多 255 個選項)、評分(2 到 10 個有序等級)、是非題(值即機率)。所有問題在同一次呼叫裡平行計算,加問題幾乎不增加延遲。延遲落在 70 到 500 毫秒。定價是輸入每百萬 token 0.042 美元,輸出免費,因為它不產生文字。

訓練方法名為 RLCD,目標是讓信心值與命中率一致,也就是說回報八成信心的答案,在統計上約八成正確。這與常見的 RLHF(對齊人類偏好)目標不同。但方法本身沒有公開獎勵函數、資料集或訓練細節,目前無法重現。創辦人受訪時表示,訓練只用合成資料。

官方評測數字

官方工作流評測共 711 案、四條工作流,參考答案拿兩個大模型的平均,不是標準答案。結果如下:

工作流 Jev 最佳對照
資安事件 61.7% 66.2%
助手軌跡觀測 71.6% 76.6%
發票處理 61.8% 79.1%
客服 76.0% 78.3%
平均 67.8% 74.1%

成本與延遲欄全勝,準確度欄全輸。官方自己把最佳的 193.6 倍快、444.6 倍便宜標註為高標,不是常態。另一個獨立小樣本(Every,777 個判斷)不到 0.7 秒花約 0.0025 美元,12 篇寫作品質檢查中位數 0.35 秒一篇,對照大模型高推理檔 8.83 秒,約 25 倍快、約五百八十分之一成本,植入缺陷抓到六比七。

官方承認的限制

官方承認幾件事。展示用的查詢經過簡化,對模型有利。工作流評測拿兩個大模型的平均當參考答案,不是標準答案。「零幻覺」的零不是量測值,而是結構保證:輸出一定落在事先給的選項裡,不會生出第四個選項。但選錯選項仍然可能,官方文件也承認高信心答錯存在。

能力邊界頁寫得相對坦白:數學、計數、日期比較不可靠,間接問題弱,狀態摻入雜質會退化,輸入預設不當成惡意內容,相依問題之間沒有邏輯一致性保證。一個是非題與其否定句的機率加總可能超過一。選項務必保留其他或資訊不足,否則模型只能在既有選項裡硬選。

第三方評測怎麼看

OrcaRouter 的獨立測試目前最扎實:37 份文件乘 21 題,在 0.7 秒內完成,結論是這不是前沿模型的平替,而是中階判斷以零頭成本跑每一步。Arize 用垃圾郵件分類做小規模對照,Jev 與傳統分類器打平,重點是信心值可用來決定哪些送人工:把 4.6% 的量送審,剩下達到 99.5% 準確。Arize 建議的架構是全量用 Jev 跑,再抽失敗樣本丟大模型拿解釋,因為 Jev 不寫解釋。

Snehal 等幾篇拆解文共同指出三點:信心值是分布統計量,不是正確性保證;選項是條件化的,二選一的機率必和為一,即使證據兩邊都不支持;平行輸出無法反推架構,擴散、編碼器或改造解碼器的猜測都只是猜測。

開源復刻一週內跟上

Jev 權重沒有開源,但介面一週內被復刻:

專案 作法 校準 熱度
SemIf(前名 OpenJev) 凍結 Qwen3.5-4B,直讀選項對數值,瀏覽器可跑 只有 softmax,無 RLCD ★約 1.9k
jevlike 自訓小型編碼器,筆電 CPU 可跑 未宣稱 ★約 800
mini-jev 凍結 Qwen3-4B,讀選項字母對數值加差距,帶網頁服務 帶差距的排序 早期★約 11
LocalJev 用 DiffusionGemma 寫 JSON 再正規化,線路相容 Jev 格式 模型自報,非直讀 ★548(兩天)
jeff/kev 等 小編碼器或讀出頭,純 CPU 可跑者有之 溫度縮放或訓練頭 實驗性

公開子集上,SemIf 0.845 對 Jev 公開值 0.883,差距約四到七個百分點。三方橫評的共識一致:凍結權重直讀對數值,給的只是排序,校準要靠訓練或事後校正;本地版贏在隱私與離線,不在成本,因為 Jev 的定價已經是地板價。

展示聚落:別人拿它做了什麼

官方示範之外,社群一週內長出四個展示聚落:jevable(約 40 個作品流)、jev.directory(可直接複製別人送出的請求)、jevplayground(免登入跑真的模型)、systemonemodels(第三方目錄)。模式高度一致:Jev 只做判斷,執行、寫字與權限全留給程式。

瀏覽器操作是最紅的一條。browser-use 官方的 Jev Ultrafast讓 Jev 一次選操作加頁面元素,要打字才叫小模型,機票示範 7 秒花 0.0039 美元,rtrvr.ai 實測開 Jev 後任務省約三到四成時間,但大頁面計分讓總成本上升,同篇有完整數字。手機測試方面,Callstack 把無障礙快照轉成動作選項,一次測試跑 14 秒花 0.0023 美元,有命令列工具可直接拿自己的 App 試。macOS 電腦操作有人做到約 0.0002 美元一步。

交易方面,jev-trader 每個 Monad 區塊對 Kuru 市場做一次決策,站點與程式都公開。高頻交易網紅也有同賽道教學,但只跑一天、無損益數字,證據等級差一截。

程式碼審查有魔術審查球(點 PR 問該不該合併,約 200 毫秒給判決)、jev-codes(拿 diff 對規範包稽核,倉庫內含評測)、分階段審查儀表板。搜尋重排方面,BM25 先召回、Jev 重排是常見組合;TC39 提案分類 324 案乘九維度,12.7 秒跑完;三千筆零食多條件打分,28 秒花 0.11 美元。安全方面,npm 安裝前閘門約 100 毫秒,Discord 審查機器人多題平行跑加升級階梯。遊戲與無人機示範則證明 500 毫秒內能塞進即時迴圈。

多數仍是原型,有星數不等於有校準,採用前要先看倉庫有無評測。

爭議

HN 主串(1,790 分、471 則留言)的戰場有二:一是「不會幻覺」到底指結構還是真值,放行未授權動作仍符合結構的例子被反覆引用;二是原始標題把成本速度倍數與前沿模型並列是否誤導。社群提出的類比多半指向零樣本分類器,差別在於 Jev 每題都給機率,而前沿模型的機率拿不到或不可靠。RLCD 究竟是護城河還是行銷詞,目前沒有可重現的證據,只能等校準曲線圖與第二家獨立複測。

小結

把 Jev 理解成新的介面形狀,比理解成新的智慧等級更貼切。它把「下判斷」從「寫一段話再解析」裡拆出來,變成便宜、快速、可進程式分支的值。單一高頻環節值得一試:影子模式先跑,再用兩百到五百筆標註量校準,定閾值後才上線。整條工作流一次換過去、拿它寫字算數、照抄官方閾值、私密資料直送雲端,四種做法都不值得。校準說法是否撐得住真實工作量,是唯一還沒被驗證的關鍵。其餘部分,包括速度、成本、結構保證與開源替代的差距,都已經有數字可以討論。

資料來源:TypeSafe 官方部落格Business Wire 融資公告TechCrunch 專訪OrcaRouterArize 獨立評測、Apidogmrjev 開源橫評、HN 主串OpenJev 串討論、systemonemodels 目錄。完整筆記與連結收在我的研究庫,本文只取可驗證的部分。

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *