八月底,OpenRouter 上冒出一個沒有名字的模型,代號 ox-alpha。免費開放一週,結果直接衝上全站用量第一。幾天後 Z.ai 出面認領:這是 GLM-5.3-Flash。先有口碑、後有名字,這種出場方式在 LLM 圈幾乎沒見過。也因為這樣,它的程式能力評價比一般新模型可信一點:大家是先用過、覺得好,之後才看到跑分。
這篇把官方跑分、第三方指數、Reddit 和 X 上的實測心得整理在一起,回答一個問題:GLM 5.3 Flash 寫程式到底有多強?
結論先行
約等於 Claude Opus 4.8 的程式水準,低於 GPT-5.6 Terra、Gemini 3.7 Flash 這些封閉頂級,大勝上代 GLM-5.2。真正的賣點不是最強,是次旗艦的實力、零頭的價格。先提醒一句:下面的官方分數都是 Z.ai 自家 harness 跑的,第三方獨立複現還很少,差距小的請當方向性看。
規格速覽
- 320B MoE,每 token 只啟動 18B,1M context
- GLM-5 系列第一個原生多模態模型:text、image、video 同一個模型吃
- MIT 授權 open weights,vLLM、SGLang、TokenSpeed 都能託
- 上市價 input $0.15 / output $0.50 per 1M tokens,9 月 9 日前促銷半價
官方跑分:貼著 Opus 4.8
Z.ai 公布的 coding 與 agent 分數(同 harness、mini-swe-agent / Claude Code):
| Benchmark | Flash | GLM-5.2 | Opus 4.8 | GPT-5.6 Terra | Gemini 3.7 Flash |
|---|---|---|---|---|---|
| DeepSWE v1.1 | 63.4 | 46.2 | 58.0 | 69.6 | 65.3 |
| Terminal-Bench 2.1 | 84.3 | 81.0 | 85.0 | 87.4 | 85.8 |
| Z.ai Code Bench(max effort) | 29.0 | – | 29.5 | – | – |
| Toolathlon Verified | 78.4 | 59.9 | 76.2 | 74.9 | – |
| AutomationBench | 48.8 | 26.2 | 41.0 | 37.2 | 52.3 |
| NL2Repo | 56.3 | 48.9 | 69.7 | – | – |
怎麼讀這張表:DeepSWE 從上代的 46.2 跳到 63.4,直接超車 Opus 4.8 的 58.0,但離 Terra 的 69.6 還有一段。Terminal-Bench 84.3 緊咬 Opus 的 85.0。唯一的明顯短板是 NL2Repo,56.3 對 69.7,輸 13 個點,repo 級規格還原還是不如 Opus。
跟自家旗艦 GLM-5.3 比,同 harness 下 Flash 63.4 對 66.9,只差 3.5 個點。但 Qubrid 算過帳:每解出一題的成本,Flash 約 $0.075,旗艦約 $1.28,差 17 倍。3.5 個點的差距,價格差 17 倍,這就是 Flash 存在的理由。
第三方指數:coding 持平 Sonnet 5
- Artificial Analysis:Intelligence 57.5,Coding Index 71.5,Agentic 58.2
- Coding 71.5 剛好跟 Claude Sonnet 5 打平,贏 Sonnet 4.6 的 63,輸自家旗艦的 74.8
- Agentic 58.2 明顯贏 Sonnet 5 的 49.7,貼近旗艦的 59.1。agent 能力是它的強項,跟 ox-alpha 時期全是 agent 框架(Hermes Agent、Claude Code、Cline)在灌流量的用法對得上
社群實測:盲測封神是真的
ox-alpha 那一週,OpenRouter 單週用量第一、全站 token 佔比近兩成,前三大用量來源全是 agent 框架。DEV 社群有人寫得好:所有模型發表都被自家跑分包裝,只有 ox-alpha 是大家先用過、喜歡上,之後才知道它是誰。這段盲測口碑,比發表會上的表格可信。
Reddit r/LocalLLaMA 的 megathread(近 300 分、200 多則)氣氛偏正向:有人說這是第一次不管開不開源都想用的開放模型,拿來當 subagent daily-drive 沒問題。跟 Qwen3.8-Flash-Next 對比那篇,結論是 GLM 比較強,但以 320B 對 125B 的體型差來看,贏幅不如預期。
幾個具體實測:Cline 官方說 ox-alpha 是 Cline 史上成長最快的模型,不到一週吃下全站 11% 推理量,修自家 repo 一個真 bug 跟 Fable 同樣修好、少用約 3 倍 output token。YouTube 有人拿 21 個 prompt 在 OpenCode 實測,一個 prompt 約 2 美分、跑 9 分鐘,品質跟 DeepSeek V4 Flash 同檔,但找 GPT 當裁判比 code quality,GLM 寫的 code 比 DS4F 乾淨。HF discussion 也有人回報:複雜任務(瀏覽器遊戲、newsletter app)很強,300B 級自託首選。
三個誠實的缺點
第一是慢。Artificial Analysis 實測 Flash 跑完一整套要 14.4 分鐘,Luna 2.6 分鐘、V4 Flash 5 分鐘,AA 有史以來最慢之一。r/opencode 有人嗆:該叫 batch mode,flash 在哪。不過也有人緩頰,上線首日很快,是被擠爆才慢 10 倍,而且 Z.ai 第一方 API 本來就慢(約 49 t/s),Databricks 同模型能到 273 t/s。結論:慢有一半是選 host 的問題。
第二是定價溝通。免費一週後收費,r/opencode 有人開罵:2x usage 跟 50% 折扣標示混亂,8k requests 一個月一下就燒完,在 Flash 跟便宜 4 倍的 DS4 Flash 之間糾結。免費的最貴,這句老話又應驗一次。
第三是推理檔預設 max 太燒。r/ZaiGLM 有人寫 WooCommerce theme 實測,85% 的 coding 情境 high 比 max 好,max 容易繞圈 overthink、多燒 token。剛好 OpenCode 目前切 reasoning effort 對 Flash 沒真正生效、永遠跑 max,這點要留意。另外有一個 SGLang 後端的多工具 prompt 會讓 thinking 退化成無限 !!!!! 的 issue,自託的人會遇到。
要怎麼用它
- 當便宜主力:日常 coding、讀 code、跑指令、小修改全丟 Flash,難題再 escalate 到旗艦或閉源。有人算過,這種 cascade 只要 escalation 不超過 94%,永遠比全用旗艦便宜
- reasoning 用 high:除非跑分,max 的 token 花下去通常不值得
- host 要挑:Z.ai 第一方慢,第三方(Databricks、OpenRouter 上其他 provider)快好幾倍,先測再選定
- 前端工作加分:原生看截圖,破圖直接貼圖問,比用文字描述排版快
- 碰客戶資料就自託:第一方 API 沒有 DPA、沒有 zero-retention,權重是 MIT 的,要合規就自己跑
定位總結
GLM-5.3-Flash 是目前便宜檔裡,程式能力最接近 Opus 等級的選擇之一,agent 場景尤其划算。它不是最強的模型,是把「夠強」賣到最便宜的模型。資料缺口也先講清楚:官方沒發 MMLU、GPQA 這類學術分數,知識型任務無據可判;GLM 家族在 HN 有 token burn 比 GPT 高 50 到 100 倍的抱怨,單價便宜、總 token 花得多,帳要自己算。
參考資料:Z.ai 官方發表、Artificial Analysis、Qubrid 成本分析、eesel 實測、HF discussion 實測串
