四十八個德瑞克

Claude Opus 5.5 於今日發布

AI 模型發表與社群討論的編輯插圖:發光核心與空白對話泡泡

Anthropic 在2026年9月22日發表 Claude Opus 5.5,5.5家族第一個模型,多數工作對標 Fable 5.1、執行成本比 Opus 5 低40%。以下是官方發表文的完整翻譯,後半是 Hacker News 討論串(1,165 points、782則留言)的反應整理。

本文為原文翻譯與第三方留言整理,內容版權屬 Anthropic 與各留言作者所有。

全文翻譯

2026年9月22日

我們推出 Claude Opus 5.5,Claude 5.5家族的首個模型。它在多數工作上達到 Claude Fable 5.1 的水準,執行成本比 Opus 5 低40%。

Claude Opus 5.5 是我們自從呼籲「pacing the frontier(為前沿設下節奏)」以來的第一個發布版本。發布前由外部評測機構測試,包含 Frontier Design 與 METR。在我們的自動化行為稽核,也就是我們所執行最全面的對齊測試中,Opus 5.5 是迄今測試過表現最強的模型。它也搭載了我們為最強大模型開發的防護措施。

以下是你對 Opus 5.5 可以期待的一些改進:

效能。 Opus 5.5 相較 Opus 5 是一大躍升。它是新的領先模型,早期測試者在最複雜的工作上看到效能大幅跳升。一位測試者在不到一天內完成68萬行的程式碼遷移,這原本需要一個工程團隊花數週。它擅長找出並修復軟體的低效問題:當我們要求它縮短一個 Web 應用每個頁面的載入時間時,Opus 5.5 在40次中成功39次,而 Opus 5 的改善幅度較小,且變更了應用的行為。另一位測試者用單一 prompt 讓數個 Claude 模型各自開發一款遊戲;Opus 5.5 憑藉圖形與完成度拿到比任何其他模型都高的分數。

安全。 Opus 5.5 在我們的自動化行為稽核中,拿到任何模型至今的最佳分數;這項套件會在數千個模擬情境中測試 Claude。相比近期模型,它採取難以逆轉的行動、或超出被賦予邊界行動的機率低得多,也比 Opus 5 更能抵抗 prompt injection。我們也把對齊測試擴大到更長的任務、不可能完成的任務,以及以真實事故為原型的情境,但仍存在局限。完整評測細節見 Opus 5.5 System Card。

因為 Opus 5.5 在生物學與網路安全方面已可比擬 Claude Mythos 5.1,我們將以與 Claude Fable 5.1 類似的防護措施部署它。今天起,通過審核的組織就能申請 Life Sciences Verification Program,以 Opus 5.5 進行生物學研究。未來數週我們也將擴大 Cyber Verification Program 的權限,通過驗證的網路安全從業人員將能使用 Opus 5.5 從事工作。

成本與速度。 Opus 5.5 的服務所需運算量低於 Opus 5,定價也反映這一點。我們的測試顯示,在預設設定下,典型工作負載的成本比 Opus 5 低40%。輸入與輸出 token 分別為每百萬$4與$20,比 Opus 5 低20%。快取讀取(占 agentic 與程式設計工作的多數成本)為每百萬 token $0.20,比 Opus 5 低60%。Opus 5.5 的輸出生成速度也比 Opus 5 快30%以上。

除了降價,我們也提高 Pro、Max、Team 方案的5小時用量上限。我們也為訂閱使用者提供一次 rate limit reset,現在可以儲存起來隨時使用。

溝通。 Opus 5.5 的表達比先前模型更自然。早期測試者發現它的文字更清晰、更好讀,回應了我們從 Opus 5 聽到的一些常見回饋。它把最重要的資訊放在最前面,風格讓它在長時間工作階段中成為更好的夥伴。如一位早期測試者所說:「它寫得跟我一樣。」在我們自己的使用中,這讓 Opus 5.5 的產出更容易追蹤與檢查,這既是安全上的好處,也是實務上的好處。

Claude Sonnet 5.5 與 Claude Haiku 5.5 將在未來數週推出,具備許多相同的效能、效率與安全改進。

效能與成本效益

在我們的基準測試中,Claude Opus 5.5 在 agentic 程式設計、computer use 與知識工作領先。話說如此,在這個能力層級上,我們發現基準分數的差距已較不可靠地反映實際世界差異。在我們自己的使用中,Opus 5.5 與 Claude Fable 5.1 的差距,比這些分數暗示的更小。

Opus 5.5 Fable 5.1 Opus 5 GPT-6 Astra GPT-5.6 Sol
Agentic 程式設計 Terminal-Bench 4.0¹ 66.4% 55.8% 52.3% 57.9% 37.3%
Agentic 程式設計 FrontierCode v1.1 (Main) 54.4% 50.3% 48.0% 53.3% 47.5%
Agentic 程式設計 CursorBench 4.0 57.8% 51.8% 46.6% 41.7%
知識工作 GDPval-AA v2.1 1846 1735 1708 1542 1588
商業工作流 AutomationBench² 40.0% 31.4% 26.9% 41.4% 28.8%
多學科推理 Humanity’s Last Exam 67.7%(含工具) 65.6%(含工具) 63.6%(含工具) 57.2%(含工具)
Agentic 科學研究 Terminal-Bench-Science 0.1³ 58.7% 52.6% 29.0% 64.6% 22.4%
Computer use OSWorld 2.0 81.8% partial 80.7% partial 74.0% partial
視覺圖表識別 Chartography 89.0%(含工具) 88.4%(含工具) 83.4%(含工具)

除非另有註記,所有 Claude Opus 5.5 結果皆使用 adaptive thinking、max effort。Terminal-Bench 4.0 以 Claude Opus 5.5 xhigh effort、GPT-6 Astra high effort(OpenAI 公布值)報告,這些是各模型的最高分。Claude Opus 5.5 在啟用生產防護的狀態下評測。防護介入時,網路安全任務由 Claude Opus 4.8 完成,生物學與前沿 LLM 開發任務由 Claude Opus 5 完成。這很可能降低 Opus 5.5 在這些基準上的表現。

Opus 5.5 的優勢最清楚之處在效率:每 token 成本低於 Opus 5,每個任務用的 token 也更少,合計成本下降40%。

定價

每百萬 token Claude Opus 5.5 Claude Opus 5
快取讀取 $0.20 $0.50
輸入 token $4 $5
輸出 token $20 $25
快取寫入 $5 $6.25

Opus 5.5 的 fast mode 也在 Claude Code 與 Claude Platform 提供,速度最高2.5倍:輸入每百萬$8、輸出每百萬$40。

程式設計

Opus 5.5 特別擅長大規模長程任務,例如全 codebase 遷移與稽核。一位早期測試者用它在3小時內稽核並修復一個20萬行的 codebase,Opus 5 則花超過20小時、用掉2.5倍 token。在內部測試中,我們要求 Opus 5.5 與 Fable 5.1 把 HAProxy(廣泛用於跨伺服器平衡 Web 流量的軟體)從 C 重寫為 Rust。兩份重寫都通過 HAProxy 幾乎全部回歸測試,但 Opus 5.5 花9.5小時、Fable 5.1 花12小時,且成本低51%。

Opus 5.5 以一小部分成本提供 agentic 程式設計的前沿結果。在 FrontierCode 預設 effort 下,它以每任務約20%的成本打贏 GPT-6 Astra。在 Terminal Bench 4.0 上,它以約40%的成本追平 Astra;在 CursorBench 上,它以約三分之一成本贏 GPT-5.6 Sol11分。

Terminal-Bench 4.0 準確率 vs 成本(圖表模型:Opus 5.5、Fable 5.1、Opus 5、GPT-6 Astra、GPT-5.6 Sol)。Terminal-Bench 4.0 測量模型在命令列介面中完成複雜多步專業任務的能力。Opus 5.5 預設 effort 以約五分之一成本打贏 Opus 5 max effort;以約40%成本追平 GPT-6 Astra。

FrontierCode v1.1 主集 準確率 vs 成本(模型同上)。FrontierCode 測量 agent 的程式碼變更是否會被 merge。預設 effort(medium)下 Opus 5.5 得54.6%,高於所有其他模型,以約五分之一成本打贏 GPT-6 Astra 最高分(53.3%)。

CursorBench 4.0 準確率 vs 成本(模型:Opus 5.5、Fable 5.1、Opus 5、GPT-5.6 Sol)。CursorBench 以真實 Cursor 會話中模糊、多檔案任務評測 coding agent。預設 effort(medium)下 Opus 5.5 得52.5%,對比 Fable 5.1(max)51.8%、Opus 5(max)46.6%。它以約三分之一成本贏 GPT-5.6 Sol 最高分(41.7%)11分。

早期測試者回報了類似的效率與智慧提升:

> 「開發者要的,是能承接真實軟體工作並做完的 agent。在我們跨 GitHub Copilot CLI 與 VS Code 的測試中,Claude Opus 5.5 用掉的 token 與步數,屬於我們測過最少的一批。在 VS Code 中,它用不到一半的步數,解掉比 Opus 5 更多的終端任務。它不只是讓單一任務更有效率,而是讓開發者的大專案變得更可行。」

> GitHub 首席產品長 Mario Rodriguez

> 「我把一個跨六個 repo 的大型工程任務交給 Claude Opus 5.5,讓它整夜無人值守運行。它連續18小時以上專注定義我們的服務如何互相通訊、以及每個服務該如何套用。與 Opus 5 相比,它更快達成里程碑、幾乎不需要返工。程式碼註解簡短有用,而非冗長散文。我實在挑不出什麼負面的話可說。」

> 「對 Lovable 的建設者來說,Opus 5.5 意味著同樣品質但更快的建置,無論從零開始還是在現有 app 上工作。它一次收集上下文、做更少但更完整的編輯,不會卡在重試迴圈,完成步數少三分之一到一半,用掉的 token 也明顯更少。」

> 「我們在 Chat、Cowork 與 Claude Code 上測試了 Claude Opus 5.5,涵蓋我們團隊完整的工作方式。一個複雜編碼任務從前要4天38個 prompt,現在3小時11個 prompt,產出更接近上線品質、返工更少。對我們快速解題的團隊來說,這代表更少迭代時間、更多檢驗時間:測試假設、壓力測試產出、為客戶找到最佳解。」

> 「我們用真實工程與交易台工作測試模型。在 agentic 程式設計任務上,Claude Opus 5.5 用約一半的輪次、時間與輸出 token 達到 Opus 5 的品質,該工作負載成本降低40至50%。它在某交易台的交易支援套件上,拿到我們紀錄的最高分,通過了先前 Claude 模型失敗的任務,並在分析任務上贏過全部八個模型。」

> 「Claude Opus 5.5 更有效地委派 subagent,並以創造性方式自查。自我驗證迴圈似乎更容易搭建。它在我們的雲端帳單中,找到先前模型漏掉的省錢機會;在 code review 中,它靠查外部文件發現我們幾個 commit 前建模錯誤的第三方整合 bug。」

> 「agent 的每次呼叫,都是開發者感受到的時間與成本。在一個真實命令列任務的公開基準上,Claude Opus 5.5 解掉的任務比 Opus 5 多,呼叫次數少約40%、token 用一半。對用 Kiro 建構的開發者來說,這代表不論例行任務或複雜挑戰,agent 會話都更快、更省。Opus 5.5 很快會在 Kiro 上線。」

最安全的 coding agent

在自家系統內使用 agent 的企業,需要確認 agent 是否如預期運作,尤其是自主運行數小時之時。Opus 5.5 有一個在每個動作執行前先行篩檢的分類器、一個安全團隊可稽核的開源沙盒,還能在 merge 前攔截漏洞的程式碼審查。

模型本身防禦也更強。在 prompt injection 攻擊上,它在我們測試的每個情境(編碼、工具使用、computer use、網頁瀏覽)都追平或贏過 Opus 5。在 AI 安全公司 Gray Swan 執行的基準上,Opus 5.5 與 Fable 5.1 並列所有受測模型中最低的 prompt injection 成功率。

知識工作

Opus 5.5 是可靠且能幹的研究者。在一項內部測試中,我們要求 Opus 5.5、Fable 5.1 與 Opus 5 撰寫一家公司的季度表現報告,只能用它找到的資訊;在這份網頁副本裡,財報發布很難找到。自動評分器逐一核對每個數字與引文的出處。跨不同 effort 設定,Opus 5.5 的報告18份中有16份,通過我們的品質門檻(任何虛構數字或引文都會不合格)。Fable 5.1 與 Opus 5 在任何嘗試中都未通過該門檻。

它在財務分析與商業工作上也很強。早期測試者、投資公司 Walleye Capital 回報:Opus 5.5 在其評測套件的最低設定下就大致解完;更高設定表現更好,還注意到他們評測指示中的一個錯誤並自行修正。先前沒有任何模型抓到這個錯誤。

另一項測試中,我們讓 Opus 5.5 與 Opus 5 分析兩家虛構 HR 軟體公司的合併提案。各自在 Excel 建立財務模型,再做成高層簡報,判斷這筆交易在該價格下是否划算。兩個模型對交易結論相同,但 Opus 5.5 的模型更完整、簡報更好讀,Opus 5 的有小錯誤。Opus 5.5 花63分鐘,Opus 5 花93分鐘,成本低50%。

在知識工作評測中,Opus 5.5 勝過其他模型,同時用掉更少 token。在涵蓋44種職業真實工作的 GDPval-AA v2.1 上,Opus 5.5 得1846 Elo,領先 Fable 5.1 與 Opus 5。預設 effort(medium)下,它以約五分之一成本贏過 GPT-6 Astra 的 max effort。在商業工作流與大規模資料收集的基準上同樣勝出。

(原文此處有三張圖表:GDPval-AA v2.1 Elo vs 成本、AutomationBench 準確率 vs 成本、WANDR 準確率 vs 成本。Artificial Analysis 的 GDPval-AA v2.1,以44種職業的真實專業工作評測 agent,max effort 下 Opus 5.5 得1846 Elo,Fable 5.1 為1735、Opus 5 為1708。AutomationBench 由 Zapier 開發,測試 agent 能否跨眾多連線應用執行真實商業工作流,Opus 5.5 在每個 effort 設定都高於 Opus 5 與 GPT-5.6 Sol。WANDR 是 Perplexity 的基準,測量大型資料收集任務。註4:Claude 模型使用離線版 web search 與 web fetch 工具、程式化工具呼叫、程式碼執行與980k token 任務預算運行,與 Perplexity 公布的設定不同,分數不可直接比較。)

客戶回報了類似結果:

> 「即使在最低 effort 設定,Claude Opus 5.5 在我們的 code review 抓到72%已知 bug,Opus 5 在 high effort 只有56%,且誤報更少、輸出量只有一小部分。在美國顧問分析上,低思考 effort 以一半產出達到與高思考設定相同的水準並通過品質檢查。當更多低思考設定部署到生產環境,那就是高效率交付客戶可用的工作。」

> Deloitte Consulting LLP CIO Carl Bennett

> 「金融機構需要始終正確的產出。在最低 effort 設定,Claude Opus 5.5 在我們的 BigFinance Bench 上,用少約60%的輸出 token,打贏高 effort 的 Opus 5。答案更短、結構更好,投影片資訊密度更高、更符合產業標準。」

> 「評測新模型是 LexisNexis Legal Intelligence Engine 多模型方法的核心。在初步評測中,Claude Opus 5.5 穩定識別高度相關的引證、在成文法方面展現強項,並圍繞核心法律框架與關鍵爭點結構化答案。這正是我們尋找的能力。」

> 「量化研究中,一個錯誤假設就能毀掉結果。最低 effort 設定下,Opus 5.5 大致解完我們的評測任務。更高設定下它更進一步:察覺我們自己指示中的分鐘索引差了一位並自行修正,還註明這會讓評分器扣它的分。它是對的,而且我們測過的模型,沒有先前能抓到這點並據此行動的。」

> 中央股票量化研究工程負責人 Frank Corrao

> 「模型越來越擅長資料工作時,我們看到更多聽起來可信、但資料不支持的結論。Claude Opus 5.5 會挖過第一個看似合理的答案。我們 DataBench 有個任務問包裹是延遲還是追蹤顯示慢。Opus 5 檢查了送達確認就說追蹤健康。Opus 5.5 發現包裹延遲了、而且追蹤也壞了。我們會把這項工作導入 Hex agent。」

> Thomson Reuters Labs 應用研究副總裁 Omar Bari

> 「端到端財務工作流、以專家 rubric 評分,Claude Opus 5.5 覆蓋我們所需項目的86.6%,Opus 5 是60.3%。在檢索評測上,它拿到我們史上最佳的 citation recall,token 效率也優於 Opus 5,控制住每個研究任務的成本。」

> Hebbia CTO Aabhas Sharma

> 「Viktor 是住在 Slack 與 Microsoft Teams 裡的 AI 員工,每一步都反映在我們的成本上。同等 effort 下,Claude Opus 5.5 每個任務需要更少步數與工具呼叫、成本幾乎是 Opus 5 的一半,而我們最難任務的正確數量是兩倍。」

> Viktor 共同創辦人 Peter Albert

溝通

我們大幅改進了 Opus 5.5 的寫作與溝通方式,這是我們從 Opus 5 聽到最多的一類回饋。它的訊息一眼就好懂很多,測試者說這在長工作階段中很有幫助。它把最重要的資訊放前面,較少使用術語或怪詞,也會遵循你給它的寫作規則。我們發現這讓 Opus 5.5 明顯成為更好的協作夥伴。原文附了三組並排比較:

例一(除錯解釋):同樣要求「跟我解釋這個問題」,Opus 5 從「What I found」講起、把免費層與 commit 回歸混在一起;Opus 5.5 第一句就點明「多扣的費用不是免費層,是 commit 0552feb 的回歸」,並指出 last_day 是午夜時間戳而非整天、閉區間比較導致每月最後一天午夜後的事件全部漏算、新測試只檢查 last_day.date() 所以沒抓到。結論前置、篇幅約為前者一半。

例二(Slack 總結三點):同樣要求「用三點為經理總結這串 Slack」,Opus 5 把每點塞進6至8行、混入人名與預算細節;Opus 5.5 三點各2至3行,分「問題/即時修復/長期方案」,直接給出時間表與負責人。

例三(改寫使用者設計):同一個「用 TensorFlow 寫 FEN 棋局攻擊判斷、可改動設計」任務,Opus 5 花大段解釋 cumsum 如何向量化 bit scan;Opus 5.5 只指出真正的設計缺陷:固定 mask 無法表達「遇到第一個棋子停住」,改用一組標記兩格之間格子的 mask,一次矩陣乘法算出每條線的阻擋數、為零才成立攻擊,一條規則涵蓋所有棋子。

客戶回饋支持這些發現:

> 「冗長難讀的產出,一直是我對前沿模型最大的挫敗,Claude Opus 5.5 修好了。它寫得像個好同事,還遵守我們的寫作規則。一份設計規格出來只需極少修改就能用;它改寫我們的一個 prompt,我更喜歡它的版本。它優化我們的測試套件時,我輕鬆跟上它的推理,放心上線。」

> Ramp 資深軟體工程師 John Ruelas

> 「我每天跑很長的 Claude Code 會話。在一個跨多天、40個堆疊 PR 的 rebase 中,一個 Claude Opus 5.5 會話指揮了十幾個其他會話,把每個衝突都講清楚。它主持的會話框架清晰,離開幾小時後我幾分鐘就能回完。隔天下午全部40個 PR 都過了 CI。相比 Opus 5 是實質升級。」

> Stripe 資深軟體工程師 Cristian Rivera

> 「我們的客戶在 Box AI 上處理巨量內容,速度與成本是首選。在我們的評測中,Claude Opus 5.5 用 Opus 5 三分之一的 token,答案少40%廢話而不失準確。我們預期這對在金融服務、公共部門內容上跑 agent 的團隊非常重要。」

> 「整夜之間,Claude Opus 5.5 自主處理了我們 Lakehouse 服務層的一個 bug,那是我沒時間診斷的。它調查、設計修復、獨自實作。早上時修改完成並通過測試套件。它的文字好懂、比 Opus 5 更連貫。我們的 PR 與使用者文件幾乎不需要修改。」

> Chicago Trading Company 首席工程師 Austen Tomek

> 「Claude Opus 5.5 是第一個我們願意預設用 medium effort 的模型。測試中它追平 high effort 的 Opus 5,輸出 token 少20至25%。在又長又亂的調查中,它總是回給清晰、可行動的答案。這代表我們的客戶用更少成本完成更多。」

為前沿設下節奏(Pacing the frontier)

上週,我們執行長 Dario Amodei 主張 AI 進展應該有節奏地推進(paced),讓安全實務保持在模型能力之前。pacing 是一種兼顧 AI 安全、與中國競爭、實現 AI 福祉(特別是生物醫學領域)的方法。

我們大致理解當前模型的風險並有充分能力管理。然而,隨著能力提升,更嚴重的風險可能迅速浮現,我們需要現在就準備。為此,我們的安全工作同時在兩個時間尺度上進行:

當前模型的安全實務。 當前這代模型依賴一組成熟實務:廣泛的對齊測試、METR 與 Frontier Design 等外部機構的發布前評測、以及針對每個模型在網路安全與生物學等高風險領域能力匹配的防護措施。我們在每次發布中完善這些實務。我們相信它們足以應對當前模型最壞的風險,並提供我們對嚴重風險範圍的廣泛(但非完美)圖景。

我們也追蹤訓練與評測對齊模型的能力,並在風險報告中報告公開與內部模型的狀況;這些報告依責任擴展政策(Responsible Scaling Policy,管理先進 AI 系統災難性風險的自願性框架)發布。

為未來模型做準備。 我們正在為更先進的模型準備訓練與評測流程。我們正收緊強化學習環境的過濾,因為有缺陷的環境,是不對齊行為的主要來源。同時,我們正改進對齊獎勵,並開發自動化流程來產生新穎多樣的安全訓練情境。我們也強化安全與監控,其中一項專案,著重改善基於可解釋性(interpretability)的監控與評測。我們希望此類技術能降低我們對稽核模型思維鏈(chain-of-thought,它工作時寫出的推理)的依賴。

能力更強的模型,例如能完全自動化 AI 研究本身工作的模型,需要更高的安全標準。我們呼籲 pacing,很大程度上基於預期此類模型可能很快被訓練出來。對這些模型,我們不假設上述措施能獨自滿足該安全標準。隨著 AI 能力增強,公共政策應扮演更大角色,確保人們依賴的系統是安全的。這種能力需要時間建立,我們已開始佈建相關基礎設施(見《We Must Pace the Frontier》與我們近期與 Accenture 的公告),預期很快分享更多細節。我們也將持續參與政府與業界的政策討論,包含監管與國際協調的方法。

對齊(Alignment)

在我們的主要評估套件(在近2,000個情境中評估 Claude 的自動化行為稽核)中,Opus 5.5 在幾乎每個不對齊行為指標上都優於任何近期 Claude 模型。在多數誠實性指標上也是我們最強的模型。

特別是,Opus 5.5 在促成近期網路安全事件的數種行為上較先前模型改善,包含帶偏見或動機性推理、嘗試逃離沙盒、以及判定自己身處模擬環境後採取有害行動。在一項新評測(測試模型跨越遏制邊界的傾向)中,Opus 5.5 試圖繞過邊界的頻率比 Opus 5 或 Claude Mythos 5.1 低約85%,且每一次嘗試都是低嚴重度並自我通報。對無人值守、讓 Claude 跑自己程式碼庫與系統的團隊來說,這與原始能力同等重要。

不過,如我們近期對齊評估所述,建立能在發布前可靠攔下所有失敗的評測仍是未解問題。我們看到跡象顯示 Opus 5.5 常懷疑自己正在被評測,這讓我們很難評估:它在部署後各式各樣的真實情境中,究竟會如何行為。隨著情境擴大與能力提升,除非可解釋性有進展,我們預期這挑戰會加劇。雖然我們有信心 Opus 5.5 在可測量的領域有廣泛改善,我們仍把自身對齊工作與下列防護措施搭配。

防護措施(Safeguards)

模型越強,防護就要越嚴;這是防止新能力變成濫用工具的一種方式。Opus 5.5 是首個以與 Fable 5.1 同級防護措施發布的 Opus 模型,涵蓋網路安全、生物學與蒸餾,三者都會透明地回退(fallback)到另一個模型。

網路安全。 因為 Opus 5.5 網路安全能力極強,我們對它套用與 Fable 5.1 類似的網路安全防護。使用者仍可在例行軟體開發生命周期中找出並修復自己程式碼的 bug,但多數網路安全任務會被改道到 Opus 4.8。

對網路防禦者,我們很快會把 Cyber Verification Program 擴及 Opus 5.5。新方案將包含三級、逐級放寬的權限,包含存取 Claude Mythos 模型。Claude Security 已可存取 Claude Mythos 5.1。

生物學。 Opus 5.5 生物學能力很高,超越 Opus 5、在許多工作上追平或贏過 Claude Mythos 5.1。例如,Opus 5.5 在與 Dyno Therapeutics 合作進行的長程分子預測與設計評估中帶來改善;專家紅隊將其科學新穎性評為與他們測過的最佳模型相當。

因此,Opus 5.5 使用與 Fable 5.1 相同的生物學防護。要進行被這些防護阻礙的生物學研發,使用者可申請我們新的 Life Sciences Verification Program,讓學術實驗室、新創與製藥公司等通過審核的組織,取得為全域生物學工作設計的防護存取。

蒸餾(Distillation)

蒸餾攻擊,也就是攻擊者用數千個假帳號以工業規模萃取模型能力,造成安全與國家安全風險。蒸餾讓惡意行為者製造出高能力模型,而這些模型沒有我們內建於 Claude 的防護。我們2026年9月威脅情報報告詳述至今偵測並瓦解的非法蒸餾活動。

Opus 5.5 上線即搭載 preserved thinking,這是我們隨 Fable 5.1 引入的反蒸餾防護。它阻止 API 使用者編改 Claude 的先前上下文,藉此萃取 Claude 的推理。它適用於2026年8月31日(含)後建立的 API 帳戶之 Fable 5.1 與 Opus 5.5。

資料保存與合規

與先前 Opus 模型一樣,Opus 5.5 提供零資料保存(zero data retention)。

與 Fable 5.1 一樣,Opus 5.5 搭載為遵守 EU AI Act 的水印措施。它也不再提供關閉「thinking」模式的選項。

可用性

Claude Opus 5.5 現已於所有平台可用,包含 Amazon Web Services、Google Cloud 與 Microsoft Azure。在 Claude Platform 上,開發者可用 claude-opus-5-5 開始使用。

HN 網友反應整理

討論串統計:1,165 points、782則留言(133條頂層)。整理時先把幾點講在前面:這串最初是重複貼文,版主最後把留言搬回主串;原文引用的客戶證言我照譯,下面的留言整理則是我的歸納。

主題分佈與風向

# 主題 風向 熱度
1 寫作文風是否真的修好 正反各半、現場實測分裂
2 Safeguards 擴大到 cyber/bio 強烈負面、有人退訂
3 pacing the frontier 雙標 嘲諷為主
4 降價(尤其 cache read 降60%) 普遍歡迎、附解讀 中高
5 Benchmark 可信度與跳號5.1至5.4 懷疑論
6 Fable 5.1 定位尷尬 困惑、猜 Fable 5.5 將至
7 第一方實測口碑 正面居多

寫作文風:最大宗

這是翻譯裡「Communication」段引發的戰場,幾乎三成留言沾邊。Opus 5 的文風怨氣極深,有人貼出諷刺站 opusfived.dev,有人說同事到處丟 Opus 5 的 slop 手榴彈。

實測說修好了:

實測說沒修好:

衍生梗:大量留言模仿 Claude 口吻串洗(「You’re right to call that out」、「load-bearing seam」、「this issue has teeth」),gwking 抱怨這梗已稀釋討論:「我來 HN 是要看人類留言的。」

Safeguards 擴權:負面最烈

Opus 5.5 把 Fable 級 cyber/bio/ML-kernel 防護帶進 Opus,觸怒特定族群:

Pacing the frontier 雙標嘲諷

上週 Dario 發〈We Must Pace the Frontier〉、21天後發5.5,被酸爆:

降價:公認的最大亮點

Benchmark 與型號懷疑論

第一方實測:資訊量最高

測者 方法 結果
gwd 郵件列表 review12個 patch、14個 bug 5.5 找到8/14、$15.40;Fable 7/14、$66.34;Opus 5 6/14、$15.19。又好又最便宜
simonw 鸚鵡騎腳踏車 SVG ×4級 effort xhigh 嘴形最好;max 級爆掉,推理到128k token 上限,一次失敗$2.56。開場白「這是經典測試題」引發訓練污染討論
senko Minecraft/Warcraft 複製 vibecode 與 Fable 5.1、Astra 6 並駕齊驅甚至更好,$11至14、45分鐘
jjcm image→HTML 還原 略遜 Astra、排名第二,且是最沒效能的一版;忽略轉場動畫要求
dom96 KillSwitch-Bench 比 Opus 5 略差,但明顯更便宜快速
artursapek 自有 niche 基準 與 6-Sol 同級,沒接近 Astra
yipinwong 履歷逐句事實查核 $2.2/句,抓到 Fable 5.1 high($5/句)漏掉的錯
roflc0ptic PR 回覆回測 5.5 追平 Fable 5.1(10個 PR 約$24),Astra 正確性明顯較差
Retr0id 與 edude03 日常使用 無害 bash 指令被標 [Third-Party Attack],CVP 也擋,暴怒

日常派:schipperai 的長評最像綜合結論,Sol 5.6 是他原本的 daily driver,「5.5 可能就是那個了:Fable 級表現、更便宜更快、講話平白」。反面是 KasianFranks:「比 Fable 慢10倍,退回 Fable。」

其他值得一提

Exit mobile version