智譜在 2026 年 8 月 26 日發布並開源 GLM-5.3-Flash,是 GLM-5 系列第一個原生多模態模型。最引人注目的不是哪一項 benchmark 破紀錄,而是它站上了一個過去不存在的能力區間:Artificial Analysis 智能指數拿到 57 分——與 Claude Opus 4.8 同分——但每任務成本只要 $0.045,大約是那個能力等級過去價格的十分之一。

規格速覽
| 項目 | GLM-5.3-Flash | 對照 GLM-4.5 |
|---|---|---|
| 總參數 | 320B | 355B |
| 激活參數 | 18B | 32B |
| 層數 | 45 | 92 |
| 架構 | MoE;稀疏注意力+線性注意力混合(GLM 系列首次)、mHC | |
| 上下文 | 1M tokens(OpenRouter 列 context 1,048,576 / 最大輸出 131,072) | |
| 授權 | 權重開放於 Hugging Face(MIT),支援 SGLang / vLLM / TokenSpeed / KTransformers | |
三份原始資料:官方部落格公告、Z.ai API 定價頁、Hugging Face 模型卡。技術報告見 arXiv:2602.15763《GLM-5: from Vibe Coding to Agentic Engineering》。
架構:為「極低成本推理」重新設計
GLM-5.3-Flash 的總參數量其實和兩年前的 GLM-4.5 相當(320B vs 355B),但激活參數和層數幾乎砍半。省成本的關鍵在三件事:
- 混合注意力:線性注意力用狀態建模處理局部依賴,稀疏注意力靠輕量索引器召回全局上下文。對比自家旗艦 GLM-5.3,attention 計算量降為 1/3、KV cache 體積降為約 1/4.4。
- IndexPool:在 1M 上下文長度下,把索引器的四個 key 向量經加權池化壓成一個,進一步削延遲與記憶體開銷。
- mHC(Manifold-Constrained Hyper-Connections):改善 scaling 效率的層間連接設計。
配上全新的 30T token 多模態預訓練語料,官方對整包改動的一句話總結是「more intelligence with less compute」。從模型卡可確認它是從全新訓練的 base model 出發,不是既有模型的後訓練版本。

Benchmark:全面超越 GLM-5.2,逼近 Opus 4.8
| 測試 | GLM-5.3-Flash | GLM-5.2 | Claude Opus 4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 84.3 | 81.0 | 85.0 |
| DeepSWE v1.1 | 63.4 | 46.2 | 58.0 |
| AutomationBench v1.0.6 | 48.8 | 26.2 | 41.0 |
| HLE w/ Tools | 55.3 | 54.7 | 57.9 |
| GDPval-AA v2 (Elo) | 1773 | 1504 | 1582 |
| Z.ai Code Bench v1.0(max effort) | 29.0 | — | 29.5 |
值得注意的是薄身激活帶來的推論成本優勢沒有換來 agentic 任務的退讓:DeepSWE 和 AutomationBench 兩項長程代理任務不只贏 GLM-5.2,也壓過 Opus 4.8。GDPval-AA v2 的 Elo 甚至高於榜上所有對比模型。


定價:牌價已是旗艦十分之一,現正五折
Z.ai API 官方定價(每百萬 tokens):
| 模型 | 輸入 | Cached 輸入 | 輸出 |
|---|---|---|---|
| GLM-5.3-Flash 牌價 | $0.15 | $0.03 | $0.50 |
| GLM-5.3-Flash 限時五折(至 2026/9/9 24:00 UTC+8) | $0.075 | $0.015 | $0.25 |
| GLM-5.3 / GLM-5.2 | $1.40 | $0.26 | $4.40 |
以牌價對牌價算,輸入約為旗艦的 1/9、輸出約 1/9——官方行銷寫「one-tenth the price」,折扣期更是十五分之一。綜合 Artificial Analysis 的 per-task 成本口徑($0.045/task 折扣價),它直接重畫了智能/成本 Pareto 前沿:同一張圖上,過去 57 分 智能 全部落在右側 $0.5 以上的區域。
上市前匿名公測:ox-alpha 三週冠軍
智譜在正式發布前把這顆模型掛了個假名 ox-alpha(中文社區暱稱「牛來」)放上 OpenCode 與 OpenRouter 收集真實回饋,結果直接衝上雙平台當週最受歡迎模型:OpenRouter 六天吃下 23.2T tokens、約第二名 DeepSeek-V4-Flash 的 2.3 倍;OpenCode 七天用量 43T tokens。這些流量全部由國產 AI 晶片承接。


國產晶片上的大規模服務
為了在記憶體容量與頻寬都受限的國產晶片上撐起 1M 上下文服務,智譜在 SGLang 上建了專屬推理引擎:節點內張量並行(Linear Attention 與 LM head)、ReplaySSM、W8A8 量化、INT8/FP8/BF16 混合 cache 量化、Layer Split,再以 Encode–Prefill–Decode(EPD)分離架構拆成獨立擴縮的 worker pool。相對同硬體基線端到端性能提升 3 倍,per-token 成本已達主流 NVIDIA GPU 水準。
另一個有意思的細節:kernel 開發與性能瓶頸診斷是由 GLM-5.3 驅動的基礎設施 agent 輔助完成的——模型參與優化了服務自己的系統。
多模態著力點:讓模型看到自己的產出
原生多模態的賣點不是「能貼圖問答」,而是把視覺接進 coding 迴路:前端與遊戲開發的最終產物是介面與互動,很多失敗只在渲染、操作、遊玩時才會浮現。訓練管線聚焦自我視覺判斷(self-visual judgment)與測試時改進——模型與環境互動、檢查自己的產出、迭代修正;GUI 判斷則透過基於真實使用者流程的 agent 驗證強化。延伸到專業工作場景,它能直接讀文件、表格、簡報、dashboard 等異質素材聯合推理,並對自己產出的排版品質做視覺自評。
官方放的三個示範作品裡,有一份 NASA/JPL 風格的《八大行星太陽系巡禮》PDF 海報集——如果你在某些管道看到這篇文章連結預覽抓到的是行星海報內容而非模型新聞,原因就是那段正文工具誤抽到了這份嵌在頁面裡的 demo 檔案。
怎麼用
- API:Z.ai 文件,五折促價至 9/9。
- Coding Plan 訂閱戶:已在所有 GLM Coding Plan 生效,可用配額遠高於 GLM-5.3(一樣的訂閱費,消耗速率低一個量級)。
- ZCode:多模態搭配 Browser Use/Computer Use,agent 點網頁、操作桌面應用並目視驗證結果。
- 本地部署:Hugging Face 權重(MIT),SGLang、vLLM、TokenSpeed、KTransformers 均已支援。
小結
GLM-5.3-Flash 證明的事很樸素:前沿級智能未必需要前沿級價格。方法不是單點技巧,而是三層疊加——用更少算力吐出更强能力的架構、更豐富的多模態語料、以及與推理硬體共同設計的服務堆疊。對實際做 agent 工作流的人而言,$0.075/M 的輸入價意味著長上下文、多輪、大吞吐的 pipeline 第一次可以用「不心疼」的心態跑。官方也明講這套配方會沿用到下一顆更大的 frontier model。
備註:benchmark 數字取自官方公告及官方頁面內嵌圖表;定價以 docs.z.ai 於 2026/8/27 之牌價與促銷標示為準,促銷至 2026/9/9。