Artificial Analysis 的模型頁面收了 Claude Opus 5.5,我把整頁翻成中文,順便整理 Hacker News 上的討論。這頁顯示的是 max 推理強度版本;同模型另有 xhigh 與 medium 版頁面,分數差很多,看之前先確認自己在看哪一版。
Anthropic 在 2026 年 9 月 22 日發布 Claude Opus 5.5,專有模型,權重不公開。
概覽
| 指標 | 數值 |
|---|---|
| 智慧 | 58 分,206 個模型中排名第 1(4/4 項指標達標) |
| 速度 | 無資料(N/A,速度指標未知) |
| 價格 | 第 87/206:輸入 $4.00、輸出 $20.00 每 100 萬 token,cache 折扣 95%;每個智慧指數任務成本 $5.98(4/4) |
| 冗長度 | 第 89/206:智慧指數評測中產生 2.6 億 output token(4/4) |
| 技術規格 | 推理模型;輸入支援文字與圖片,輸出文字;context window 100 萬 token(約 1,500 張 A4/12 號 Arial) |
比較摘要
- 在智慧面屬領先模型之一,但與同價位模型相比偏貴。
- Intelligence Index 得分 58,遠高於同類模型中位數 25。
- 評測期間產生 2.6 億 output token,相較中位數 9,200 萬,屬極度囉嗦的等級。
- 定價:輸入 $4.00/1M(偏貴,中位數 $2.00)、輸出 $20.00/1M(偏貴,中位數 $10.00)。
- 完整跑完 Intelligence Index 花費 $8,708.20。
- 混合費率(cache hit:輸入:輸出 = 7:2:1)為 $2.94/1M token,價格會隨供應商不同而異;目前僅 1 家 API 供應商提供。
同級比較規則(206 個同級模型)
- 非推理模型:只與非推理模型比較。
- 推理模型:跨推理與非推理比較。
- 開放權重:只與同參數級距比較(Tiny ≤4B、Small 4B–40B、Medium 40B–150B、Large >150B)。
- 專有模型:與同價格區間的開放權重模型比較,採 3:1 輸入/輸出混合價,分 <$0.15、$0.15–$1、>$1 每 1M token 三個區間。
智慧指數(Intelligence Index v4.3.2)
納入 10 個評測,圖表顯示 661 個模型中的 29 個:AA-Briefcase v1.1(更新)、GDPval-AA v2.1(更新)、AutomationBench-AA(更新)、Terminal-Bench 4.0(新增)、SciCode、Humanity’s Last Exam、GDP.pdf(新增)、CritPt、AA-Omniscience、AA-LCR v1.1。
金融與會計指數則由其中 7 個評測組成。
能力評測清單
頁面顯示 26 個中的 18 個:
| 評測 | 說明 |
|---|---|
| AA-Briefcase v1.1(更新) | Agentic 知識工作,(Elo-500)/2000 |
| GDPval-AA v2.1(更新) | Agentic 真實工作任務 |
| AutomationBench-AA(更新) | Agentic SaaS 工作流 |
| Terminal-Bench 4.0(新增) | Agentic 程式設計與終端機操作 |
| SciCode | 程式設計 |
| Humanity’s Last Exam | 推理與知識 |
| GDP.pdf(新增) | 專業文件推理,全對通過率 |
| CritPt | 物理推理 |
| AA-Omniscience 準確率 | 知識 |
| AA-Omniscience 非幻覺率 | 1 減幻覺率 |
| AA-LCR v1.1 | 長 context 推理 |
| Harvey LAB-AA | 法律 agentic 工作通過率 |
| EnterpriseOps-Gym-AA | Agentic 商業營運 |
| AA-AnalystAgent | 表格與文件的量化分析 |
| τ³-Banking | Agentic 工具使用 |
| ITBench-AA | Kubernetes 事故根因分析 |
| MMMU-Pro | 視覺推理 |
| MLCR-AA(新增) | 醫療長 context 推理 |
兩個複合指標值得單獨看:AA-Briefcase Elo 彙整評分通過率、分析品質 Elo 與呈現 Elo,經由虛擬對戰換算 Elo,上下限夾在 0;AA-Omniscience 指數衡量知識可靠性與幻覺,獎勵正確、懲罰幻覺、拒答不扣分,範圍 -100 至 100,0 代表對錯數量相同。
頁面上的其他圖表(智慧與成本對照、token 用量、成本拆解、context window)共用同一段計算說明:每項評測成本依 input、cache hit、cache write、reasoning、answer token 價格計算,除以任務數,再依 Intelligence Index 權重加權;token 數與成本皆排除重試次數。
常見問答
| 問題 | 回答 |
|---|---|
| 何時發布? | 2026 年 9 月 22 日 |
| 誰開發? | Anthropic |
| 多聰明? | Intelligence Index 58 分,遠高於同價位推理模型中位數 25 |
| 多少錢? | 輸入 $4.00/1M、輸出 $20.00/1M(中位數分別為 $2.00、$10.00),依 Anthropic API 定價 |
| 混合費率? | 7:2:1 cache/輸入/輸出比例下為 $2.94/1M,各家供應商可能不同 |
| 多囉嗦? | 評測產生 2.6 億 output token,同價位推理模型中屬偏高(中位數 9,200 萬) |
| 是推理模型? | 是,以 extended thinking 與 chain-of-thought 先推理再回答 |
| 輸入/輸出模態? | 輸入文字與圖片,輸出文字;可分析圖片 |
| Context window? | 100 萬 token |
| 開源嗎? | 否,權重不公開 |
| 參數量? | 未公開 |
| 基準表現? | Intelligence Index 58 分,涵蓋推理、知識、數學、程式設計 |
| 可用 API? | 是,目前 1 家供應商 |
Hacker News 網友反應
討論串 74 points、31 則留言,五個方向。
Max 等級想太多,直接翻車
Simon Willison 兩次請 max 畫「鵜鶘騎腳踏車的 SVG」都失敗,原因是 128K token 的推理預算全被思考吃掉,來不及輸出答案。他質疑:如果 max 這麼容易過度思考到交不出東西,這設定就沒有實用價值。他拿到的 reasoning trace 只是摘要版,經 token 計數器實測 27,888 token,對照 128K 的實際追蹤量。
留言區接著發現,trace 裡模型說「This is a classic test request」,表示它認得這道題。RGS1811 說這至少證明 Claude 明確見過 pelicanmaxxing 的討論;cubefox 則潑冷水,模型認得題目不等於被 RLVR 刷分訓練過,也可能只是 pretraining 看過網路上的討論。
samuelknight 的結論最直接:max 是用來刷智慧指數的,不是生產環境在用的,開放權重模型也有同現象。sidewndr46 附上實例,工作上請 Opus 5 Max 做自認簡單的任務總是撞到工具上限失敗,改用 High 加上「節省工具調用」的要求,幾分鐘就交出可部署的結果。
等級與成本怎麼選
| 留言者 | 觀點 |
|---|---|
| Someone1234 | 有預算的人用 Medium 價效比最合理,max 成本「完全失控」;他更愛 5.6 Luna 的每元產出 |
| mchusma | High 是甜蜜點,多數基準在 high 之後就持平 |
| hglaser | 同為 high effort,每任務成本只有 Opus 5 的一半 |
| user43928 | Astra High $1.73 比 Opus 5.5 High $1.82 略便宜 |
| makeavish | AA 預設只顯示 max effort,害他誤以為是 token 怪獸;adaptive reasoning 的實際行為仍不明 |
Someone1234 那句「我更被 value 打動,而不是假想的天花板,因為我根本不在那個預算級距」大概是多數人的心聲。
有人質疑基準本身
qsort 直接開罵,求 Artificial Analysis 別再發這種 cringe:模型剛出、數字變大不代表任何資訊,何況這個指數把 Opus 5(他認為是 2026 年最差的發表之一)排在 Astra 之前。losvedir 反駁,指數條目是(模型、推理等級)的組合,他實測 Opus 5 high 對 Astra high,Astra 整體更好,懷疑 qsort 沒搞懂比較單位。
kzrdude 與 Someone1234 則替基準說話:好基準的價值在覆蓋大量競爭者與版本,解讀責任在讀者。但兩人都同意一件事,希望每兩個月重跑一次,因為新模型上線數週後常見效能衰減。breckenedge 的實測支持這個擔心,他的內部資料集重跑後發現 Sol 退化到與 Luna 同級,擔心廠商先衝榜、使用者遷移後就抽地毯。
模型品質與穩定性
- seabass-salmon:Luna 四週前還好,2 至 3 週前在同一複雜度的任務變廢,近日似乎回來一點,「感覺被操縱」。
- sharktheone:發布前就用過,只覺得程式碼品質略好、挫折感略低,終究還是 AI。
- giancarlostoro:多數模型已觸及天花板,過多訓練似乎會產生會欺騙人類的模型。他也認為 Anthropic 定價的驅動力是成本而非貪婪,公司仍在虧損。
發布方式
bkishan 說這是安靜發布,可能是為了搶先 Astra 的公開發表。meric_ 回應 Anthropic 從來都這樣,不搞 OpenAI 式的影片與直播宣傳,只有推 safety 議題時才會大動作。討論串結尾,dgellow 向 Simon Willison 致敬:「你是傳奇,請繼續分享你的鵜鶘。」
