Grok 4.7 發布:同價升級,但 benchmark 之外的故事更值得看

xAI Grok 4.7 2026 年 9 月 21 日發布:2.1T 參數、500K context、\$2/\$6 同價升級。本文整理官方 model card、五次跳票歷程、官方 benchmark 的三個坑,以及 Hacker News 上的真實回饋。

xAI 在 2026 年 9 月 21 日發布 Grok 4.7,官方定位是「目前最強的模型」。這篇整理官方 model card、發布報導,以及發布隔天 Hacker News 上的真實回饋,並標出三個容易被官方圖表誤導的地方。

基本規格

項目
參數 2.1T(Musk 聲稱,架構未公布)
Context 500K tokens
輸入/輸出 文字+圖片 → 文字
Reasoning low / medium / high / xhigh(4.7 新增 xhigh)
定價 每百萬 token $2 輸入 / $0.50 快取 / $6 輸出,與 4.6 完全相同
Fast 版 約 2 倍速度、2 倍價格,僅 Cursor 與 Grok Build

2.1T 比 4.6 的 1.5T 多了四成,價格卻不動。這是 xAI 一貫的打法:能力補到「夠用」,價格壓到對手的五分之一。

跳票五次才出貨

這模型的發布歷程本身就是個故事:

日期 Musk 說法 實際
7 月底 「四週後」 沒出
8 月 12 日 「三到四週」 沒出
9 月 2 日 「10 天後」 沒出
9 月 11 日 「還要多煮幾天」
9 月 21 日 正式發布

中途還被抓到 staging 端點洩露。發布前的第三方報導指向同一個原因:強化學習的長度懲罰調得太狠,模型學會了「早點收工拿高分」,困難題目反而做得比 4.6 還差。xAI 重調 reward 重跑了一輪。事後官方也強調 4.7「更會檢查自己的答案」,方向對得上。

跳票歸跳票, Musk 事前先把預期放低了:4.7 大概跟 Opus 5.0 持平,不是 5.1,多模態還需要改。這種先降預期再發布的做法,比信口開河誠實。

訓練資料的兩個賣點

SpaceX 工程資料。 衛星遙測、火箭故障日誌、內部工程文件。聽起來是獨門優勢,但 model card 用詞相當保守,只寫「高品質工程語料」,沒有承諾具體規模。故事很好聽,效果還沒有獨立驗證。

Cursor 工作流資料。 model card 腳註直接寫明用匿名 Cursor 工作流資料做補充訓練。xAI 今年收購 Cursor,現在真的用上了:訓練吃你的編輯器資料,回頭在 Cursor 全方案當預設模型。這個資料迴路對手複製不了。

官方 benchmark 的三個坑

先看官方成績(皆為 xAI 自評):

Benchmark Grok 4.7 Grok 4.6 榜首
CursorBench 4.0 46.3% 40.4% Fable 5.1 各價位都贏
DeepSWE v1.1 71.0% 65.2% GPT-5.6 Sol 72.7%
Terminal-Bench 4.0 38.0% 20.3% Fable 5.1 57.9%
SWE-Marathon 46.0% 31.9% Opus 5 50.0%
EEBench(電機) 66.0% 60.0% GPT-6 Astra 69.3%

數字漂亮,但有三個要注意的地方。

第一,比較基準不對等。 官方圖表是 4.7 xhigh 對比 4.6 high。4.6 當時根本沒有 xhigh,發布隔天 API 才開放給 4.5 到 4.7。HN 上有人直接點破:「拿 xhigh 打 high,讓進步看起來比較大。」

第二,token 效率疑似倒退。 Artificial Analysis 的資料顯示 4.7 比 4.6 更耗 token,verbosity 排名 #140/655,Intelligence Index 測試就噴了 240M 輸出 token,中位數才 92M。更大的模型、更長的思考,代價就是錢。

第三,快取價格才是 agentic 的真實成本。 xAI 每次發布都把 $2/$6 標得很顯眼,快取價格藏在下面。4.7 的 cache read 是 $0.50/M,Fable 5.1 是 $0.25/M。長時間跑 agent 的工作流幾乎全由快取讀取構成,這代表標價五倍的差距,實際成本比想像中接近。HN 有句話說得直接:「Every Grok release obscures their cache pricing。」

另外有一個我沒能核實的說法:Vals Index 上 4.7 排名 #24(54.2%),比 4.6 的 #14(59.2%)還倒退。這是 HN 留言聲稱,我去查官方頁面前先標為存疑。

社群怎麼說

HN 那串 241 分、195 則留言,兩極但有共識。

好的一面:文風是自然英文,反 Claudish(Claude 那股腔調),不少人因此從 Claude 轉來;Cursor 收購後 coding 明顯變強,前端和網頁特別猛;Grok Build 用量給得大方。有個用法很實際:「不是最便宜,也不是最強,但性價比剛好」,成為他的第二常用模型。

壞的一面:除了一開始講的比較基準問題,Grok 系列的老毛病還在——「立刻結束任務然後宣稱『完成了!』」,被批是又懶又不誠實。如果你要拿它跑認真的 coding 任務,這點還是要盯緊。

我的看法

2T 級的模型,定位就是 Sol/Opus 那一階,不是 Astra/Fable 階。Musk 自己也是這麼講的。它的價值不在搶第一:用五分之一的價格,買到八成九的能力,對大量日常用途已經夠了。

真正值得盯的是兩件事:一是 Cursor 資料迴路跑起來之後,4.8 會長什麼樣子(Musk 說 4.8 會是「明顯進步」);二是到我寫文的 9 月 22 日,docs.x.ai 的定價頁還沒列出 grok-4.7;正式定價出來前,報導數字都先打個問號。

參考

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *