四十八個德瑞克

Artificial Analysis:Claude Opus 5.5 max 版

抽象渦旋光核插畫,代表 AI 模型過度推理

Artificial Analysis 的模型頁面收了 Claude Opus 5.5,我把整頁翻成中文,順便整理 Hacker News 上的討論。這頁顯示的是 max 推理強度版本;同模型另有 xhigh 與 medium 版頁面,分數差很多,看之前先確認自己在看哪一版。

Anthropic 在 2026 年 9 月 22 日發布 Claude Opus 5.5,專有模型,權重不公開。

概覽

指標 數值
智慧 58 分,206 個模型中排名第 1(4/4 項指標達標)
速度 無資料(N/A,速度指標未知)
價格 第 87/206:輸入 $4.00、輸出 $20.00 每 100 萬 token,cache 折扣 95%;每個智慧指數任務成本 $5.98(4/4)
冗長度 第 89/206:智慧指數評測中產生 2.6 億 output token(4/4)
技術規格 推理模型;輸入支援文字與圖片,輸出文字;context window 100 萬 token(約 1,500 張 A4/12 號 Arial)

比較摘要

同級比較規則(206 個同級模型)

智慧指數(Intelligence Index v4.3.2)

納入 10 個評測,圖表顯示 661 個模型中的 29 個:AA-Briefcase v1.1(更新)、GDPval-AA v2.1(更新)、AutomationBench-AA(更新)、Terminal-Bench 4.0(新增)、SciCode、Humanity’s Last Exam、GDP.pdf(新增)、CritPt、AA-Omniscience、AA-LCR v1.1。

金融與會計指數則由其中 7 個評測組成。

能力評測清單

頁面顯示 26 個中的 18 個:

評測 說明
AA-Briefcase v1.1(更新) Agentic 知識工作,(Elo-500)/2000
GDPval-AA v2.1(更新) Agentic 真實工作任務
AutomationBench-AA(更新) Agentic SaaS 工作流
Terminal-Bench 4.0(新增) Agentic 程式設計與終端機操作
SciCode 程式設計
Humanity’s Last Exam 推理與知識
GDP.pdf(新增) 專業文件推理,全對通過率
CritPt 物理推理
AA-Omniscience 準確率 知識
AA-Omniscience 非幻覺率 1 減幻覺率
AA-LCR v1.1 長 context 推理
Harvey LAB-AA 法律 agentic 工作通過率
EnterpriseOps-Gym-AA Agentic 商業營運
AA-AnalystAgent 表格與文件的量化分析
τ³-Banking Agentic 工具使用
ITBench-AA Kubernetes 事故根因分析
MMMU-Pro 視覺推理
MLCR-AA(新增) 醫療長 context 推理

兩個複合指標值得單獨看:AA-Briefcase Elo 彙整評分通過率、分析品質 Elo 與呈現 Elo,經由虛擬對戰換算 Elo,上下限夾在 0;AA-Omniscience 指數衡量知識可靠性與幻覺,獎勵正確、懲罰幻覺、拒答不扣分,範圍 -100 至 100,0 代表對錯數量相同。

頁面上的其他圖表(智慧與成本對照、token 用量、成本拆解、context window)共用同一段計算說明:每項評測成本依 input、cache hit、cache write、reasoning、answer token 價格計算,除以任務數,再依 Intelligence Index 權重加權;token 數與成本皆排除重試次數。

常見問答

問題 回答
何時發布? 2026 年 9 月 22 日
誰開發? Anthropic
多聰明? Intelligence Index 58 分,遠高於同價位推理模型中位數 25
多少錢? 輸入 $4.00/1M、輸出 $20.00/1M(中位數分別為 $2.00、$10.00),依 Anthropic API 定價
混合費率? 7:2:1 cache/輸入/輸出比例下為 $2.94/1M,各家供應商可能不同
多囉嗦? 評測產生 2.6 億 output token,同價位推理模型中屬偏高(中位數 9,200 萬)
是推理模型? 是,以 extended thinking 與 chain-of-thought 先推理再回答
輸入/輸出模態? 輸入文字與圖片,輸出文字;可分析圖片
Context window? 100 萬 token
開源嗎? 否,權重不公開
參數量? 未公開
基準表現? Intelligence Index 58 分,涵蓋推理、知識、數學、程式設計
可用 API? 是,目前 1 家供應商

Hacker News 網友反應

討論串 74 points、31 則留言,五個方向。

Max 等級想太多,直接翻車

Simon Willison 兩次請 max 畫「鵜鶘騎腳踏車的 SVG」都失敗,原因是 128K token 的推理預算全被思考吃掉,來不及輸出答案。他質疑:如果 max 這麼容易過度思考到交不出東西,這設定就沒有實用價值。他拿到的 reasoning trace 只是摘要版,經 token 計數器實測 27,888 token,對照 128K 的實際追蹤量。

留言區接著發現,trace 裡模型說「This is a classic test request」,表示它認得這道題。RGS1811 說這至少證明 Claude 明確見過 pelicanmaxxing 的討論;cubefox 則潑冷水,模型認得題目不等於被 RLVR 刷分訓練過,也可能只是 pretraining 看過網路上的討論。

samuelknight 的結論最直接:max 是用來刷智慧指數的,不是生產環境在用的,開放權重模型也有同現象。sidewndr46 附上實例,工作上請 Opus 5 Max 做自認簡單的任務總是撞到工具上限失敗,改用 High 加上「節省工具調用」的要求,幾分鐘就交出可部署的結果。

等級與成本怎麼選

留言者 觀點
Someone1234 有預算的人用 Medium 價效比最合理,max 成本「完全失控」;他更愛 5.6 Luna 的每元產出
mchusma High 是甜蜜點,多數基準在 high 之後就持平
hglaser 同為 high effort,每任務成本只有 Opus 5 的一半
user43928 Astra High $1.73 比 Opus 5.5 High $1.82 略便宜
makeavish AA 預設只顯示 max effort,害他誤以為是 token 怪獸;adaptive reasoning 的實際行為仍不明

Someone1234 那句「我更被 value 打動,而不是假想的天花板,因為我根本不在那個預算級距」大概是多數人的心聲。

有人質疑基準本身

qsort 直接開罵,求 Artificial Analysis 別再發這種 cringe:模型剛出、數字變大不代表任何資訊,何況這個指數把 Opus 5(他認為是 2026 年最差的發表之一)排在 Astra 之前。losvedir 反駁,指數條目是(模型、推理等級)的組合,他實測 Opus 5 high 對 Astra high,Astra 整體更好,懷疑 qsort 沒搞懂比較單位。

kzrdude 與 Someone1234 則替基準說話:好基準的價值在覆蓋大量競爭者與版本,解讀責任在讀者。但兩人都同意一件事,希望每兩個月重跑一次,因為新模型上線數週後常見效能衰減。breckenedge 的實測支持這個擔心,他的內部資料集重跑後發現 Sol 退化到與 Luna 同級,擔心廠商先衝榜、使用者遷移後就抽地毯。

模型品質與穩定性

發布方式

bkishan 說這是安靜發布,可能是為了搶先 Astra 的公開發表。meric_ 回應 Anthropic 從來都這樣,不搞 OpenAI 式的影片與直播宣傳,只有推 safety 議題時才會大動作。討論串結尾,dgellow 向 Simon Willison 致敬:「你是傳奇,請繼續分享你的鵜鶘。」

Exit mobile version