OpenAI魔改Luna當決策模型硬剛Jev,圖片輸入是賣點

Decisions API 快十倍但實測比 Jev 慢又貴;企業照單全收靠的是合規與既有採購。附官方文件翻譯、HN 正反整理與互動圖解。

OpenAI 把 gpt-6-luna 拿來做決策模型,推出 Decisions API,直接對上 Jev 開闢的戰場。官方說法是比 Responses API 快十倍,只回答三種問題:條件成立的機率、固定選項二選一、有序量表分數。

本文整理官方文件重點與 Hacker News 上 47 則留言的正反意見,文末附互動圖解。

Decisions 是什麼

一次請求只有三個部分:model(目前只收 gpt-6-luna)、input(共用證據:純文字或含圖片的使用者訊息)、questions(要評估的問題)。回應是 answers 陣列,用你取的 name 對應答案。端點是專用的 POST /v1/decisions,目前為公開測試版。

三種問題型別

型別 用途 主要結果
predicate 檢查條件是否成立,例如產品有無可見損傷 probability:0 到 1 的估計值
choice 無順序分類,例如客訴該歸哪個部門 choice:你提供的其中一個值
score 有序評分,例如問題嚴重度 score:各等級索引的機率加權平均,可落在兩級之間

choice 與 score 除了答案,還會回傳各選項機率分布與 confidence。類別沒覆蓋到的輸入,記得加一個 other 後備選項,丟進通用複查佇列。

有先後依賴的判斷不要併成一題,分次請求。例如先檢查有無損傷,再依結果決定要不要問維修分類。

圖片是賣點

圖片必須是內嵌 base64 data URL,不收託管網址或 file_id。這正是多數人認可的差異點:Jev 當初最大的缺口就是不吃圖片,而 Decisions 原生支援圖文混合評估。

計價

gpt-6-luna 輸入每 100 萬 token 收 0.10 美元,只收輸入,輸出與快取免費。支援零資料保留(ZDR)與 HIPAA,資料落地限美國與歐洲。

網友反應:技術不驚喜,商業合理

唯一硬核實測:比 Jev 慢又貴

網友 Topfi 拿不到 600 次呼叫,經 OpenRouter 對打 Jev 與 Mercury Decide:Luna 約 p50 346ms、p95 860ms,比 Jev 慢;失敗 4 次,另兩家掛零;同組測試 Jev 花 0.0192 美元,Luna 花 0.06 美元,貴約三倍。標籤任務上 Jev 的分數也更符合常識(例如彭博的上證指數頁配「投資」標籤,Jev 給 0.9,Luna 只給 0.56)。

但他也承認圖片輸入還沒測,評測高度依任務而定。

企業派:有合規跟採購就贏了

最多人同意的一串恰好跟技術無關:Jev 過不了合規,有合規需求只能選 OpenAI;已經採購過 OpenAI 的企業,導入新供應商要三到六個月,加上終身 vendor management,用現有合約直接上最划算。一個月 11 美元的用量,沒人想為此自建模型或重跑採購流程。

商品化爭論:注定價格戰

Jev 證明了 System One 快思考的價值:夠快夠便宜的是非判斷,往往就是大家真正要的。開源版洗版 Hugging Face,大廠只好放棄輸出 token 收入參戰。反對自建的人則說,買或租是經濟問題:每 100 萬 token 一角美元,自己架省不了多少事。

另一派提醒:決策模型只 cover 極簡決策,真實問題多半要多屬性結構化輸出;而且模型幾週就可能被「改進」,正式用途不敢押寶。

互動圖解

手機版若看不到內嵌頁面,可直接開啟:https://derek-static.pages.dev/openai-decisions.html

來源

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *