Cognition SWE-2:效能貼著 Fable 5.1,價格少六成

Cognition 推出 SWE-2,FrontierCode 50.0% 緊追 Fable 5.1,便宜 64%。單次 RL 訓全 effort 等級,加上行為大改,Windsurf 老訂戶的心得整理。

Cognition 這間公司,很多人不太熟。它是 Devin 背後的團隊,後來把 Windsurf 剩下的品牌和應用接手下來。這兩年它一直在做一件事:擁有自己的模型。9 月 10 日推出的 SWE-2,是它離這個目標最近的一次。

我自己是 Windsurf 發布後三小時就開始用的早期使用者,每個月 10 美元的訂閱到現在還留著。所以這篇一半是整理 SWE-2 的技術內容,一半是站在老使用者立場,看 Cognition 這步棋走得怎麼樣。

先看成績單

SWE-2 在 FrontierCode 1.1 Main 拿到 50.0%,只差 Fable 5.1 的 50.9% 一個百分點,官方說法是便宜 64%。DeepSWE 1.1 是 73.0%,跟 GPT-6 Astra 的 74.1% 也只差一點,價格大約是對方的四分之一。

評測 SWE-2 Kimi K3 Grok 4.6 Fable 5.1 GPT-5.6 Sol GPT-6 Astra SWE-1.7
FrontierCode 1.1 Main 50.0% 44.2% 48.0% 50.9% 47.5% 53.3% 42.0%
DeepSWE 1.1 73.0% 68.5% 67.5% 67.4% 72.7% 74.1% 37.7%
Terminal-Bench 2.1 92.8% 88.3% 88.4% 91.4% 88.8% 89.9% 81.5%
Terminal-Bench 4 27.3% 21.5% 20.3% 55.8% 37.3% 57.9% 7.6%

有兩個地方要老實講。第一,Terminal-Bench 4 的 27.3% 跟 Fable 5.1 的 55.8% 差距很大,這是 SWE-2 最弱的一塊。第二,底座是 Kimi K3,一個 2.8T 參數、已經經過大量 agentic coding RL 的模型。Cognition 的 RL 在上面又加了五到六個百分點,算是把現成強底座的剩餘空間再榨出來。

最有意思的部分:一次訓練,整條 cost 曲線往上推

以前的做法是每個 effort 等級各訓一個專家,再蒸餾合併。SWE-2 改成單次 RL 就把所有 effort 等級一起訓起來,獎勵函數長這樣:

R = S – λe C

S 是成功或失敗,C 是成本,λe 是每個 effort 等級的成本罰權重。想法很直白:λe 對準底座模型 Pareto 曲線在那個等級的切線斜率,這樣模型想拿高分,只能把整條曲線往上推,沒辦法靠偷懶降成本來灌水。

另外兩個工程細節值得記:

  • Length-weighted baseline。從 SWE-1.6 沿用下來的技巧,用 rollout 長度近似梯度範數,當 baseline 來降變異數。Cognition 說這招讓 inference-training KL 穩很多。
  • Rollout serving。prefill delayer 把相近請求併批,DSpark 推測解碼加快生成,draft 模型還會跟著 policy 線上更新。再配 NVFP4/FP8 與量化感知訓練,底座參數幾乎是 SWE-1.7 的三倍,吞吐量還能維持。

資料側也加碼:RL 環境變成三倍,repo 分布拉開,加了 instruction-following 的疊加任務,還有用前一版 SWE-2 checkpoint 不斷修 verifier 的飛輪。Kimi K3 本來就很會鑽漏洞,不把 verifier 修硬一點,reward hacking 會先來。

行為真的變了:少逛,多寫

SWE-1.7 被抱怨過度探索,簡單任務也要把整個 repo 翻一遍。SWE-2 medium 在 FrontierCode 上分數更高,turns 少 58%,平均成本少 81%。第一次實質編輯的中位數從 48 步提前到 18 步。

我在內部測試描述裡看到三個行為,覺得比數字重要:測試寫得比較像 end-to-end,會擋 regression;路被堵住會自己找別條路,有一次 MCP 斷了,它直接從 Slack 歷史把資料拼回來;被質疑時會重推一次結論,而不是重講一次。Coding agent 用久了就知道,這三點比 benchmark 高一兩分實際。

老使用者視角:Windsurf 的 10 美元訂閱,值不值得留

Windsurf 當年吸引我的地方很簡單:編輯器裡的 agent 好用,價格直白。我這個每月 10 美元的永久訂閱一直沒退,某種程度是對那個產品手感的投票。

Cognition 接手之後,路線很清楚:不只做應用,要把模型也捏在自己手裡。這條路線,SWE-2 是第一個能打的成果。今天先上 Devin Desktop 和 CLI,Web 和 Fusion 陸續開放。短期的意義是 Devin 使用者直接受惠,長期的問題是 Windsurf 那側什麼時候吃得到,價格又怎麼算。我的訂閱會繼續留著,就等這一天。

老實說,我對 Terminal-Bench 4 那個 27.3% 有點在意。日常開發裡雜事很多,真正的勝負常常在這種地方。不過以 Pareto 的角度看,SWE-2 的位置站得很好:頂級效能的九成多,價格不到一半。對每天開著 agent 的人來說,這比多拿一兩分有感。

後續我會拿自己的 repo 實際跑看看,重點看 medium 等級在簡單任務會不會手癢亂逛。有結果再補一篇。

原文:https://cognition.com/blog/swe-2

HN 網友怎麼看:九成火力集中在 benchmaxxing

發文隔天,HN 討論串衝到 196 分、97 則留言。我掃完一遍,最大的火力集中在同一件事:Terminal-Bench 2.1 的 92.8%,對上 TB4 的 27.3%。

質疑方說 TB4 才發布兩週,這個落差就是 generalization 測驗。在已經飽和的 TB2.1 上刷高分,正是 benchmaxxing 的定義。辯護方說兩份 benchmark 難度本來就不同,Sol xhigh 也是 90% 掉到 37%。結果質疑方回馬一槍:幾個月前出的 Sol,在 out-of-sample 的 TB4 上還高 SWE-2 五成。

有幾個數字值得補在這裡,幫 27.3% 定錨。Sonnet 5 在 TB4 只有 12.4%,SWE-2 其實站在主流區間。但同天發布的 DeepSeek V4.1 Flash 是 31.2%,本地跑的 Qwen 3.8-Flash-Next 也有 25.3%。另外有人抓包 Cognition 沒放 Gemini 3.8,因為它在 DeepSWE 和舊 TB 上都很強。

其他三派,快速帶過。Kimi 底座派:美國模型都是穿風衣的 Kimi。比較公允的一則是說,RL 過的 K3 能摸到 Fable 5 等級,證明這條路走得通。閉源通路派:為什麼不用 DeepSeek Flash 4.1?不上 OpenRouter 就不試。Cognition 員工(自稱)回覆訂戶 CLI 免費一個月。產品派:有人罵 Devin 最爛,也有人留著舊價格燒 token,兩種人都有。SWE-1.6 小任務快又好、1.7 轉圈轉到放棄的評價,跟我上一段寫的過度探索對得上。

最難接的一題來自 andai:FrontierCode 官網現在只秀 cost,不秀 tokens 和時間,增益會不會全來自省 token?Kimi K3 每 token 比 Sol 便宜,但每任務更貴,正是因為吐太多 token。這題 Cognition 沒回答,我也答不出來,先記著,等實測再驗。

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *