Cognition 這間公司,很多人不太熟。它是 Devin 背後的團隊,後來把 Windsurf 剩下的品牌和應用接手下來。這兩年它一直在做一件事:擁有自己的模型。9 月 10 日推出的 SWE-2,是它離這個目標最近的一次。
我自己是 Windsurf 發布後三小時就開始用的早期使用者,每個月 10 美元的訂閱到現在還留著。所以這篇一半是整理 SWE-2 的技術內容,一半是站在老使用者立場,看 Cognition 這步棋走得怎麼樣。
先看成績單
SWE-2 在 FrontierCode 1.1 Main 拿到 50.0%,只差 Fable 5.1 的 50.9% 一個百分點,官方說法是便宜 64%。DeepSWE 1.1 是 73.0%,跟 GPT-6 Astra 的 74.1% 也只差一點,價格大約是對方的四分之一。
| 評測 | SWE-2 | Kimi K3 | Grok 4.6 | Fable 5.1 | GPT-5.6 Sol | GPT-6 Astra | SWE-1.7 |
|---|---|---|---|---|---|---|---|
| FrontierCode 1.1 Main | 50.0% | 44.2% | 48.0% | 50.9% | 47.5% | 53.3% | 42.0% |
| DeepSWE 1.1 | 73.0% | 68.5% | 67.5% | 67.4% | 72.7% | 74.1% | 37.7% |
| Terminal-Bench 2.1 | 92.8% | 88.3% | 88.4% | 91.4% | 88.8% | 89.9% | 81.5% |
| Terminal-Bench 4 | 27.3% | 21.5% | 20.3% | 55.8% | 37.3% | 57.9% | 7.6% |
有兩個地方要老實講。第一,Terminal-Bench 4 的 27.3% 跟 Fable 5.1 的 55.8% 差距很大,這是 SWE-2 最弱的一塊。第二,底座是 Kimi K3,一個 2.8T 參數、已經經過大量 agentic coding RL 的模型。Cognition 的 RL 在上面又加了五到六個百分點,算是把現成強底座的剩餘空間再榨出來。
最有意思的部分:一次訓練,整條 cost 曲線往上推
以前的做法是每個 effort 等級各訓一個專家,再蒸餾合併。SWE-2 改成單次 RL 就把所有 effort 等級一起訓起來,獎勵函數長這樣:
R = S – λe C
S 是成功或失敗,C 是成本,λe 是每個 effort 等級的成本罰權重。想法很直白:λe 對準底座模型 Pareto 曲線在那個等級的切線斜率,這樣模型想拿高分,只能把整條曲線往上推,沒辦法靠偷懶降成本來灌水。
另外兩個工程細節值得記:
- Length-weighted baseline。從 SWE-1.6 沿用下來的技巧,用 rollout 長度近似梯度範數,當 baseline 來降變異數。Cognition 說這招讓 inference-training KL 穩很多。
- Rollout serving。prefill delayer 把相近請求併批,DSpark 推測解碼加快生成,draft 模型還會跟著 policy 線上更新。再配 NVFP4/FP8 與量化感知訓練,底座參數幾乎是 SWE-1.7 的三倍,吞吐量還能維持。
資料側也加碼:RL 環境變成三倍,repo 分布拉開,加了 instruction-following 的疊加任務,還有用前一版 SWE-2 checkpoint 不斷修 verifier 的飛輪。Kimi K3 本來就很會鑽漏洞,不把 verifier 修硬一點,reward hacking 會先來。
行為真的變了:少逛,多寫
SWE-1.7 被抱怨過度探索,簡單任務也要把整個 repo 翻一遍。SWE-2 medium 在 FrontierCode 上分數更高,turns 少 58%,平均成本少 81%。第一次實質編輯的中位數從 48 步提前到 18 步。
我在內部測試描述裡看到三個行為,覺得比數字重要:測試寫得比較像 end-to-end,會擋 regression;路被堵住會自己找別條路,有一次 MCP 斷了,它直接從 Slack 歷史把資料拼回來;被質疑時會重推一次結論,而不是重講一次。Coding agent 用久了就知道,這三點比 benchmark 高一兩分實際。
老使用者視角:Windsurf 的 10 美元訂閱,值不值得留
Windsurf 當年吸引我的地方很簡單:編輯器裡的 agent 好用,價格直白。我這個每月 10 美元的永久訂閱一直沒退,某種程度是對那個產品手感的投票。
Cognition 接手之後,路線很清楚:不只做應用,要把模型也捏在自己手裡。這條路線,SWE-2 是第一個能打的成果。今天先上 Devin Desktop 和 CLI,Web 和 Fusion 陸續開放。短期的意義是 Devin 使用者直接受惠,長期的問題是 Windsurf 那側什麼時候吃得到,價格又怎麼算。我的訂閱會繼續留著,就等這一天。
老實說,我對 Terminal-Bench 4 那個 27.3% 有點在意。日常開發裡雜事很多,真正的勝負常常在這種地方。不過以 Pareto 的角度看,SWE-2 的位置站得很好:頂級效能的九成多,價格不到一半。對每天開著 agent 的人來說,這比多拿一兩分有感。
後續我會拿自己的 repo 實際跑看看,重點看 medium 等級在簡單任務會不會手癢亂逛。有結果再補一篇。
原文:https://cognition.com/blog/swe-2
HN 網友怎麼看:九成火力集中在 benchmaxxing
發文隔天,HN 討論串衝到 196 分、97 則留言。我掃完一遍,最大的火力集中在同一件事:Terminal-Bench 2.1 的 92.8%,對上 TB4 的 27.3%。
質疑方說 TB4 才發布兩週,這個落差就是 generalization 測驗。在已經飽和的 TB2.1 上刷高分,正是 benchmaxxing 的定義。辯護方說兩份 benchmark 難度本來就不同,Sol xhigh 也是 90% 掉到 37%。結果質疑方回馬一槍:幾個月前出的 Sol,在 out-of-sample 的 TB4 上還高 SWE-2 五成。
有幾個數字值得補在這裡,幫 27.3% 定錨。Sonnet 5 在 TB4 只有 12.4%,SWE-2 其實站在主流區間。但同天發布的 DeepSeek V4.1 Flash 是 31.2%,本地跑的 Qwen 3.8-Flash-Next 也有 25.3%。另外有人抓包 Cognition 沒放 Gemini 3.8,因為它在 DeepSWE 和舊 TB 上都很強。
其他三派,快速帶過。Kimi 底座派:美國模型都是穿風衣的 Kimi。比較公允的一則是說,RL 過的 K3 能摸到 Fable 5 等級,證明這條路走得通。閉源通路派:為什麼不用 DeepSeek Flash 4.1?不上 OpenRouter 就不試。Cognition 員工(自稱)回覆訂戶 CLI 免費一個月。產品派:有人罵 Devin 最爛,也有人留著舊價格燒 token,兩種人都有。SWE-1.6 小任務快又好、1.7 轉圈轉到放棄的評價,跟我上一段寫的過度探索對得上。
最難接的一題來自 andai:FrontierCode 官網現在只秀 cost,不秀 tokens 和時間,增益會不會全來自省 token?Kimi K3 每 token 比 Sol 便宜,但每任務更貴,正是因為吐太多 token。這題 Cognition 沒回答,我也答不出來,先記著,等實測再驗。
