Claude Fable 5.1 與 Mythos 5.1 重點整理:降價、科學實績,與 HN 上的文風之爭

Anthropic 發布 Fable 5.1 / Mythos 5.1:同一模型兩套防護、cache read 降價 75%、三個有外部驗證的科學案例,以及 Hacker News 八百則留言全在罵 Claude 文風。

一句話版本

Anthropic 在 9/2 發布 Claude Fable 5.1 與 Claude Mythos 5.1。同一個模型,兩套防護。Fable 5.1 開放給所有人,Mythos 5.1 只給通過審核的資安與生物研究人員。亮點不只跑分,而是 cache read 降價 75% 對 agent 使用成本的實質影響,以及幾個有實驗驗證的科學案例。

兩個模型,一個底模

Claude Fable 5.1 Claude Mythos 5.1
模型本體 相同
用途 coding、知識工作、agent 資安防禦、生物科學
取得方式 全面開放,API model id claude-fable-5-1 Trusted access 審核制,目前限美國組織

以後區分的可能不是「模型有沒有這個能力」,而是「你有沒有拿到這個 access policy」。同個底模,敞開的版本擋掉 exploit 開發,審核版才放行找漏洞。

跑分

Benchmark Fable 5.1 Fable 5 Opus 5
Terminal-Bench-Science 0.1 52.6% 24.7% 29.0%
Terminal-Bench 4.0 (agentic coding) 55.8% 42.0% 52.3%
GDPval-AA v2 (知識工作) 1853 1723 1824
Humanity’s Last Exam (無工具) 60.9% 57.8% 56.6%
AutomationBench 31.4% 17.1% 26.9%
CursorBench 3.2.0 73.4% 70.5% 70.0%

幾個要打折看的地方:

  • Terminal-Bench-Science 標準誤差 ±3.5–4.5 點,小差距別認真。
  • 跑分時 production safeguards 開著。Fable 5.1 和 Fable 5 在 OSWorld 2.0 有任務被防護擋掉直接計零分,Fable 5 在 AutomationBench 也被擋。實際能力可能比表上更高,但這個「更高」是官方自己講的,無從驗證。
  • effort 設定影響很大:Claude Code 預設 High,Claude.ai 和 Cowork 預設 Medium。官方說 Low/Medium 就能打過前代,這是省錢的重點。

真正的新聞:cache read 降價 75%

定價:

  • Input $10 / M tokens(不變)
  • Output $50 / M tokens(不變)
  • Cache read $0.25 / M tokens(降 75%)

官方估算:典型 workload 比 Fable 5 便宜約 25%,高度 agentic 的工作最多便宜約 45%。為什麼差這麼多?因為長 session 的帳單大頭就是 cache read。repo context、tool output、system prompt、歷史決策,每一輪都在重讀同一堆東西。短問短答的人省不了多少,天天跑 coding agent 的人才會有感。

這個減價方向很清楚:在跟競品搶 agent 工作負載的錢包。Qwen、GLM 那批 open weights 把純 input/output 單價壓得很低,Anthropic 沒辦法在牌面上打,就在實際用量結構上打。

科學案例:這次不是跑分,是有東西被做出來

蛋白質 binder 設計(Mythos 5.1)

給模型開源 protein design/folding 工具,設計結果送兩家外部機構實驗驗證。12 個 target 的 hit rate 接近 50%,業界典型是 10–15%。三個 target(EGFR、Nipah G、15-PGDH)的 binding affinity 比 Adaptyv Bio 競賽最佳設計高約 10 倍。講白了,模型設計的分子,拿到真實實驗室去測,真的會 bind。

但別過度解讀:binder 是藥物開發的第一步,distance to medicine 還是以「年」計算。

Venus 地形圖(Fable 5.1)

用 30 多年前 Magellan 任務的雷達影像訓練神經網路,重建 Venus 三分之一區域的高程圖。解析度從 10–20 km 到 2–3 km,高度估計最多更準 25%。Anthropic 要以 Creative Commons 釋出,給未來的 NASA VERITAS 和 ESA EnVision 任務選觀測目標用。一個模型自己翻舊資料、訓練模型、產出會進入任務規劃的公開成果,這個模式比分數有意思。

GPU kernel 最佳化(Mythos 5.1)

為 7 個開源 genomics/protein 模型寫 custom GPU kernel 加 intermediate caching,H100 上推論最多快 2.5 倍(輸出逐 bit 相同),genome-wide analysis 的 GPU 成本估降 30–60%。這種活通常要 performance engineer 團隊花幾週,學術實驗室根本請不起。模型看了公開 source code 幾天做完。Anthropic 說會開源這些最佳化。

我個人認為這三案裡最務實的是最後一個。不需要模型提出新理論,只要把研究流程裡最貴的瓶頸降下來,累積效應就很可觀。

隱私與防護

  • EFS (Enterprise Frontier Safeguards):資料存在客戶完全控制的雲端基礎設施,隱私效果等同 zero data retention,但 Anthropic 仍能防 adversarial use。今秋起分期開放企業客戶,之前符合資格者先用 ZDR 跑 Fable 5.1。
  • 資安:false positives 比前代少擋 60%。Fable 5.1 可以找 software vulnerability,但不能開發 exploit。
  • 生物:走審核制 access program,和美国政府合作,科學家的報名「即將開放」。

HN 上的反應:大家在乎的是文風

這篇在 HN 掛上 865 分、八百多則留言,討論重心完全沒在 benchmark 上,全在「Claude-isms」。Anthropic 工程師 felixrieseberg 上場說 Fable 5.1 寫作風格大幅改善、比較不像典型的 Claude,留言區不買帳。最共鳴的批評來自一個真實的長 session 交接文件:母語英文的使用者承認花一整天解析這種東西,又密又空(dense and vacuous):自創術語塞滿,實質內容沒幾句。

根因爭論分成幾派:

  • 預訓練語料說:網路英文多半是行銷文案,模型學成廣告機器人。
  • 後訓練說:風格是 RL 的產物,因為有人在 A/B test 裡對破折號和排比按了讚,跟預訓練語料頻率無關。
  • 「AI 為 AI 寫作」說:模型在長任務裡把訊號壓進更少的字當黏著劑,根本不在乎人類讀起來卡不卡。

留言區最實用的一帖是兩句 system prompt:Do not use superlatives. Do not use persuasive writing style.。有人把要求寫進 CLAUDE.md,回報輸出變長 20%,但讀快一倍。

把官方敘事和社群回饋擺一起看,我的解讀是:模型能力的敘事權在 Anthropic 手上,可讀性好不好,評分權在天天跟長 session 搏鬥的人手上。這兩邊明顯還沒對上。

我的判斷

值得認真看待的:

  1. cache read 降價對重度 agent 使用者是實質利多,實際省多少取決於你的 cache hit rate,不是官方的 25–45%。
  2. 科學 agent 的示範開始有外部驗證(實驗化、即將進入太空任務規劃、可開源的 kernel),脫離純 benchmark 表演。
  3. 「同模型、不同 safeguards」的產品切法,大概會變成高風險模型的標準形態。

要保持懷疑的:

  1. 多數數字是 Anthropic 自測,harness 對自己不陌生。
  2. 科學案例數量還很少,距離「模型穩定貢獻 discovery」很遠。
  3. 文風改進與否,官方說了不算,得自己拿長 session 驗證。

來源:Anthropic 官方發布HN 討論串

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *