一句話版本
Anthropic 在 9/2 發布 Claude Fable 5.1 與 Claude Mythos 5.1。同一個模型,兩套防護。Fable 5.1 開放給所有人,Mythos 5.1 只給通過審核的資安與生物研究人員。亮點不只跑分,而是 cache read 降價 75% 對 agent 使用成本的實質影響,以及幾個有實驗驗證的科學案例。
兩個模型,一個底模
| Claude Fable 5.1 | Claude Mythos 5.1 | |
|---|---|---|
| 模型本體 | 相同 | |
| 用途 | coding、知識工作、agent | 資安防禦、生物科學 |
| 取得方式 | 全面開放,API model id claude-fable-5-1 |
Trusted access 審核制,目前限美國組織 |
以後區分的可能不是「模型有沒有這個能力」,而是「你有沒有拿到這個 access policy」。同個底模,敞開的版本擋掉 exploit 開發,審核版才放行找漏洞。
跑分
| Benchmark | Fable 5.1 | Fable 5 | Opus 5 |
|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% |
| Terminal-Bench 4.0 (agentic coding) | 55.8% | 42.0% | 52.3% |
| GDPval-AA v2 (知識工作) | 1853 | 1723 | 1824 |
| Humanity’s Last Exam (無工具) | 60.9% | 57.8% | 56.6% |
| AutomationBench | 31.4% | 17.1% | 26.9% |
| CursorBench 3.2.0 | 73.4% | 70.5% | 70.0% |
幾個要打折看的地方:
- Terminal-Bench-Science 標準誤差 ±3.5–4.5 點,小差距別認真。
- 跑分時 production safeguards 開著。Fable 5.1 和 Fable 5 在 OSWorld 2.0 有任務被防護擋掉直接計零分,Fable 5 在 AutomationBench 也被擋。實際能力可能比表上更高,但這個「更高」是官方自己講的,無從驗證。
- effort 設定影響很大:Claude Code 預設 High,Claude.ai 和 Cowork 預設 Medium。官方說 Low/Medium 就能打過前代,這是省錢的重點。
真正的新聞:cache read 降價 75%
定價:
- Input $10 / M tokens(不變)
- Output $50 / M tokens(不變)
- Cache read $0.25 / M tokens(降 75%)
官方估算:典型 workload 比 Fable 5 便宜約 25%,高度 agentic 的工作最多便宜約 45%。為什麼差這麼多?因為長 session 的帳單大頭就是 cache read。repo context、tool output、system prompt、歷史決策,每一輪都在重讀同一堆東西。短問短答的人省不了多少,天天跑 coding agent 的人才會有感。
這個減價方向很清楚:在跟競品搶 agent 工作負載的錢包。Qwen、GLM 那批 open weights 把純 input/output 單價壓得很低,Anthropic 沒辦法在牌面上打,就在實際用量結構上打。
科學案例:這次不是跑分,是有東西被做出來
蛋白質 binder 設計(Mythos 5.1)
給模型開源 protein design/folding 工具,設計結果送兩家外部機構實驗驗證。12 個 target 的 hit rate 接近 50%,業界典型是 10–15%。三個 target(EGFR、Nipah G、15-PGDH)的 binding affinity 比 Adaptyv Bio 競賽最佳設計高約 10 倍。講白了,模型設計的分子,拿到真實實驗室去測,真的會 bind。
但別過度解讀:binder 是藥物開發的第一步,distance to medicine 還是以「年」計算。
Venus 地形圖(Fable 5.1)
用 30 多年前 Magellan 任務的雷達影像訓練神經網路,重建 Venus 三分之一區域的高程圖。解析度從 10–20 km 到 2–3 km,高度估計最多更準 25%。Anthropic 要以 Creative Commons 釋出,給未來的 NASA VERITAS 和 ESA EnVision 任務選觀測目標用。一個模型自己翻舊資料、訓練模型、產出會進入任務規劃的公開成果,這個模式比分數有意思。
GPU kernel 最佳化(Mythos 5.1)
為 7 個開源 genomics/protein 模型寫 custom GPU kernel 加 intermediate caching,H100 上推論最多快 2.5 倍(輸出逐 bit 相同),genome-wide analysis 的 GPU 成本估降 30–60%。這種活通常要 performance engineer 團隊花幾週,學術實驗室根本請不起。模型看了公開 source code 幾天做完。Anthropic 說會開源這些最佳化。
我個人認為這三案裡最務實的是最後一個。不需要模型提出新理論,只要把研究流程裡最貴的瓶頸降下來,累積效應就很可觀。
隱私與防護
- EFS (Enterprise Frontier Safeguards):資料存在客戶完全控制的雲端基礎設施,隱私效果等同 zero data retention,但 Anthropic 仍能防 adversarial use。今秋起分期開放企業客戶,之前符合資格者先用 ZDR 跑 Fable 5.1。
- 資安:false positives 比前代少擋 60%。Fable 5.1 可以找 software vulnerability,但不能開發 exploit。
- 生物:走審核制 access program,和美国政府合作,科學家的報名「即將開放」。
HN 上的反應:大家在乎的是文風
這篇在 HN 掛上 865 分、八百多則留言,討論重心完全沒在 benchmark 上,全在「Claude-isms」。Anthropic 工程師 felixrieseberg 上場說 Fable 5.1 寫作風格大幅改善、比較不像典型的 Claude,留言區不買帳。最共鳴的批評來自一個真實的長 session 交接文件:母語英文的使用者承認花一整天解析這種東西,又密又空(dense and vacuous):自創術語塞滿,實質內容沒幾句。
根因爭論分成幾派:
- 預訓練語料說:網路英文多半是行銷文案,模型學成廣告機器人。
- 後訓練說:風格是 RL 的產物,因為有人在 A/B test 裡對破折號和排比按了讚,跟預訓練語料頻率無關。
- 「AI 為 AI 寫作」說:模型在長任務裡把訊號壓進更少的字當黏著劑,根本不在乎人類讀起來卡不卡。
留言區最實用的一帖是兩句 system prompt:Do not use superlatives. Do not use persuasive writing style.。有人把要求寫進 CLAUDE.md,回報輸出變長 20%,但讀快一倍。
把官方敘事和社群回饋擺一起看,我的解讀是:模型能力的敘事權在 Anthropic 手上,可讀性好不好,評分權在天天跟長 session 搏鬥的人手上。這兩邊明顯還沒對上。
我的判斷
值得認真看待的:
- cache read 降價對重度 agent 使用者是實質利多,實際省多少取決於你的 cache hit rate,不是官方的 25–45%。
- 科學 agent 的示範開始有外部驗證(實驗化、即將進入太空任務規劃、可開源的 kernel),脫離純 benchmark 表演。
- 「同模型、不同 safeguards」的產品切法,大概會變成高風險模型的標準形態。
要保持懷疑的:
- 多數數字是 Anthropic 自測,harness 對自己不陌生。
- 科學案例數量還很少,距離「模型穩定貢獻 discovery」很遠。
- 文風改進與否,官方說了不算,得自己拿長 session 驗證。