TypeSafe Jev 生態系一週觀察:決策模型、開源復刻與展示聚落
TypeSafe AI 在九月中旬公開第一個 System One 模型 Jev。它的訴求很窄:不寫字,只對事先定義好的選項做判斷,並附上信心值。一週之內,圍繞它的第三方評測、開源復刻與展示作品全部出現。這篇把研究筆記裡可驗證的部分展開,數字與出處都保留。
Jev 是什麼
Jev 是一個閉源 API 模型,沒有公開權重,沒有論文。呼叫方式是送出一段狀態描述,加上幾個事先定義好的問題,拿回型別固定的答案。問題只有三種:單選(最多 255 個選項)、評分(2 到 10 個有序等級)、是非題(值即機率)。所有問題在同一次呼叫裡平行計算,加問題幾乎不增加延遲。延遲落在 70 到 500 毫秒。定價是輸入每百萬 token 0.042 美元,輸出免費,因為它不產生文字。
訓練方法名為 RLCD,目標是讓信心值與命中率一致,也就是說回報八成信心的答案,在統計上約八成正確。這與常見的 RLHF(對齊人類偏好)目標不同。但方法本身沒有公開獎勵函數、資料集或訓練細節,目前無法重現。創辦人受訪時表示,訓練只用合成資料。
官方評測數字
官方工作流評測共 711 案、四條工作流,參考答案拿兩個大模型的平均,不是標準答案。結果如下:
| 工作流 | Jev | 最佳對照 |
|---|---|---|
| 資安事件 | 61.7% | 66.2% |
| 助手軌跡觀測 | 71.6% | 76.6% |
| 發票處理 | 61.8% | 79.1% |
| 客服 | 76.0% | 78.3% |
| 平均 | 67.8% | 74.1% |
成本與延遲欄全勝,準確度欄全輸。官方自己把最佳的 193.6 倍快、444.6 倍便宜標註為高標,不是常態。另一個獨立小樣本(Every,777 個判斷)不到 0.7 秒花約 0.0025 美元,12 篇寫作品質檢查中位數 0.35 秒一篇,對照大模型高推理檔 8.83 秒,約 25 倍快、約五百八十分之一成本,植入缺陷抓到六比七。
官方承認的限制
官方承認幾件事。展示用的查詢經過簡化,對模型有利。工作流評測拿兩個大模型的平均當參考答案,不是標準答案。「零幻覺」的零不是量測值,而是結構保證:輸出一定落在事先給的選項裡,不會生出第四個選項。但選錯選項仍然可能,官方文件也承認高信心答錯存在。
能力邊界頁寫得相對坦白:數學、計數、日期比較不可靠,間接問題弱,狀態摻入雜質會退化,輸入預設不當成惡意內容,相依問題之間沒有邏輯一致性保證。一個是非題與其否定句的機率加總可能超過一。選項務必保留其他或資訊不足,否則模型只能在既有選項裡硬選。
第三方評測怎麼看
OrcaRouter 的獨立測試目前最扎實:37 份文件乘 21 題,在 0.7 秒內完成,結論是這不是前沿模型的平替,而是中階判斷以零頭成本跑每一步。Arize 用垃圾郵件分類做小規模對照,Jev 與傳統分類器打平,重點是信心值可用來決定哪些送人工:把 4.6% 的量送審,剩下達到 99.5% 準確。Arize 建議的架構是全量用 Jev 跑,再抽失敗樣本丟大模型拿解釋,因為 Jev 不寫解釋。
Snehal 等幾篇拆解文共同指出三點:信心值是分布統計量,不是正確性保證;選項是條件化的,二選一的機率必和為一,即使證據兩邊都不支持;平行輸出無法反推架構,擴散、編碼器或改造解碼器的猜測都只是猜測。
開源復刻一週內跟上
Jev 權重沒有開源,但介面一週內被復刻:
| 專案 | 作法 | 校準 | 熱度 |
|---|---|---|---|
| SemIf(前名 OpenJev) | 凍結 Qwen3.5-4B,直讀選項對數值,瀏覽器可跑 | 只有 softmax,無 RLCD | ★約 1.9k |
| jevlike | 自訓小型編碼器,筆電 CPU 可跑 | 未宣稱 | ★約 800 |
| mini-jev | 凍結 Qwen3-4B,讀選項字母對數值加差距,帶網頁服務 | 帶差距的排序 | 早期★約 11 |
| LocalJev | 用 DiffusionGemma 寫 JSON 再正規化,線路相容 Jev 格式 | 模型自報,非直讀 | ★548(兩天) |
| jeff/kev 等 | 小編碼器或讀出頭,純 CPU 可跑者有之 | 溫度縮放或訓練頭 | 實驗性 |
公開子集上,SemIf 0.845 對 Jev 公開值 0.883,差距約四到七個百分點。三方橫評的共識一致:凍結權重直讀對數值,給的只是排序,校準要靠訓練或事後校正;本地版贏在隱私與離線,不在成本,因為 Jev 的定價已經是地板價。
展示聚落:別人拿它做了什麼
官方示範之外,社群一週內長出四個展示聚落:jevable(約 40 個作品流)、jev.directory(可直接複製別人送出的請求)、jevplayground(免登入跑真的模型)、systemonemodels(第三方目錄)。模式高度一致:Jev 只做判斷,執行、寫字與權限全留給程式。
瀏覽器操作是最紅的一條。browser-use 官方的 Jev Ultrafast讓 Jev 一次選操作加頁面元素,要打字才叫小模型,機票示範 7 秒花 0.0039 美元,rtrvr.ai 實測開 Jev 後任務省約三到四成時間,但大頁面計分讓總成本上升,同篇有完整數字。手機測試方面,Callstack 把無障礙快照轉成動作選項,一次測試跑 14 秒花 0.0023 美元,有命令列工具可直接拿自己的 App 試。macOS 電腦操作有人做到約 0.0002 美元一步。
交易方面,jev-trader 每個 Monad 區塊對 Kuru 市場做一次決策,站點與程式都公開。高頻交易網紅也有同賽道教學,但只跑一天、無損益數字,證據等級差一截。
程式碼審查有魔術審查球(點 PR 問該不該合併,約 200 毫秒給判決)、jev-codes(拿 diff 對規範包稽核,倉庫內含評測)、分階段審查儀表板。搜尋重排方面,BM25 先召回、Jev 重排是常見組合;TC39 提案分類 324 案乘九維度,12.7 秒跑完;三千筆零食多條件打分,28 秒花 0.11 美元。安全方面,npm 安裝前閘門約 100 毫秒,Discord 審查機器人多題平行跑加升級階梯。遊戲與無人機示範則證明 500 毫秒內能塞進即時迴圈。
多數仍是原型,有星數不等於有校準,採用前要先看倉庫有無評測。
爭議
HN 主串(1,790 分、471 則留言)的戰場有二:一是「不會幻覺」到底指結構還是真值,放行未授權動作仍符合結構的例子被反覆引用;二是原始標題把成本速度倍數與前沿模型並列是否誤導。社群提出的類比多半指向零樣本分類器,差別在於 Jev 每題都給機率,而前沿模型的機率拿不到或不可靠。RLCD 究竟是護城河還是行銷詞,目前沒有可重現的證據,只能等校準曲線圖與第二家獨立複測。
小結
把 Jev 理解成新的介面形狀,比理解成新的智慧等級更貼切。它把「下判斷」從「寫一段話再解析」裡拆出來,變成便宜、快速、可進程式分支的值。單一高頻環節值得一試:影子模式先跑,再用兩百到五百筆標註量校準,定閾值後才上線。整條工作流一次換過去、拿它寫字算數、照抄官方閾值、私密資料直送雲端,四種做法都不值得。校準說法是否撐得住真實工作量,是唯一還沒被驗證的關鍵。其餘部分,包括速度、成本、結構保證與開源替代的差距,都已經有數字可以討論。
資料來源:TypeSafe 官方部落格、Business Wire 融資公告、TechCrunch 專訪、OrcaRouter 與 Arize 獨立評測、Apidog 與 mrjev 開源橫評、HN 主串與 OpenJev 串討論、systemonemodels 目錄。完整筆記與連結收在我的研究庫,本文只取可驗證的部分。
