智譜 AI(Z.ai)在 8 月 29 日釋出 GLM-5.3 的開源權重,Hacker News 上立刻以 585 分、204 則留言衝上當日熱門第 15 名。發文者只丟了一張 Hugging Face Model Card 和一則部落格連結,結果引爆的討論遠比 benchmark 數字本身更熱——本地硬體值不值得買、開源權重追近封閉大廠、舊模型該不該開放、以及那個「Emergent Cyber Capability」的安全爭議。這篇幫你把 Model Card 重點跟 200 多則留言的爭論一併整理好。
GLM-5.3 Model Card 重點
開宗明義一個關鍵:GLM-5.3 跟 GLM-5.2 用的是同一個 base model,所有進步全部來自 post-training。換言之,這不是一次大改架構,而是一次「後訓練煉金術」的展示。Model Card 上只提兩大賣點:
- 更強的 Coding:號稱是「最強 open-weights 編碼模型」,在自家 Z.ai Code Bench 上比 GLM-5.2 提升 50%;並在公開 benchmark(Terminal Bench 3.0、Agents’ Last Exam)拿下 open-source SOTA。
- Emergent Cyber Capability(湧現的網路安全能力):後訓練規模往上堆時,網路安全能力成長得比預期快。CyberGym 拿到 SOTA,而且在 exploitation(漏洞利用)鏈上越往上提升越大——比 GLM-5.2 幾乎翻倍。
規格方面:753B 參數,routed experts 這次預設改為 FP8(5.2 是 BF16),所以未量化版本約 756GB、差不多是 5.2(約 1.51TB)的一半,下載時間直接砍半——HN 上有人因此很興奮。另外支援 reasoning_effort(low / high / max,預設 max),對話場景要記得傳 clear_thinking=true。
重點 Benchmark(精簡版)
| Benchmark | GLM-5.3 | GLM-5.2 | Kimi K3 | DeepSeek V4 | Opus 4.8 |
|---|---|---|---|---|---|
| Terminal Bench 3.0 | 28.3 | 4.6 | 17.4 | – | 21.1 |
| DeepSWE | 66.9 | 46.2 | 67.5 | 62.7 | 58.0 |
| FrontierSWE | 78.1 | 67.5 | – | – | 66.5 |
| SWE-Marathon | 42.5 | 19.4 | 48.1 | – | 48.8 |
| CyberGym | 84.5 | 77.2 | 80.0 | 83.3 | 78.1 |
| ExploitBench | 54.4 | 24.4 | 32.2 | 28.8 | 40.0 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1590 | 1588 |
看點:Terminal Bench 3.0 一口氣從 4.6 拉上 28.3,直接把閉源的 Kimi 也甩開;CyberGym 全面壓過所有比較對象;ExploitBench 幾乎是 5.2 的兩倍多——「湧現的網路安全能力」不是喊假的。
Hacker News 社群在吵什麼
一、本地硬體值不值得買(最大主線)
多數留言先給出實際評測,但 200 多則裡最熱的話題是「要不要砸重金買硬體在家跑模型」,兩派互不相讓:
- 反方(雲端永遠更划算):@rkangel 說純為省錢買硬體「絕對不值得」,開源模型的雲端規模效應讓回本期長達約十年。@SwellJoe 買了 Strix Halo + 雙 32GB GPU 現在閒置,「德州 110°F 的電費和散熱錢就吃光任何省下的錢」。@loglog 補刀:如果閉源服務「該」漲到四千鎂,你自架反而花更多,因為家用硬體永遠更沒效率。@Gigachad 更直接:「self-hosting 根本是 terrible deal,API 跟自架的價差大到無法無視。」
- 正方(own the stack):@jaggederest 是代表,「最大的理由是擁有自己的 stack,這樣模型不能在你腳底下被換掉」——還反問「如果網路消失了呢?」@sneak 自封「數位末日準備者」,Mac Studio 512GB 花 $15k 也覺得值得。@Phemist 把話講得最白:「這是在擺脫與匿名雲端公司日漸敵對的關係——浮水印、靜默降級、隨機拒絕、停擺、改版 ToS、還有廣告。有自己的硬體,就沒有這個心理負擔了。」
- 中間派:@colingauvin 用數據說硬體價值會隨時間增長——他買 Sparks 時只能跑 GPT-OSS-120B(AA 分 24),現在能跑 GLM 5.3 Flash Q4(AA 分 57)「價值漲了好幾倍」。@Aurornis 建議「兩年後再買二手更划算,市場上已經開始有人清倉了」。
二、GLM-5.3 與 5.3 Flash 的實戰評價
- @revolvingthrow 稱它「想超越 DeepSeek Flash 或新 GLM Flash 時的最佳開源甜點位,能力略遜 Kimi 但好跑非常多」。
- @mmastrac(評 5.3 Flash):「DS4Flash 不錯但不夠好,GLM-5.3 滿驚人的,我丟給它的難題都能接住,而且有 DS4Flash 沒有的直覺。」
- @crossroadsguy 較保留:「推理還有很大改進空間」,但很擅長「可靠的苦力活」,只是寫 prose 很差、幾乎調不動它的習慣、偏見與過熱情。
- @scosman 一句話引爆回響:「用起來就像 Opus 4.8,是最好的那種。」還有人接龍「比 Opus 5 好多了」。
- 有趣的分歧:@redox99 說他反而更喜歡 5.3 Flash 而非 5.3——「5.3 沒有 vision 是致命傷,而且 Flash 做漂亮 UI 更在行。」
三、硬體實測:tok/s 數據交流
- @lnenad(Epyc 48c 7643 + 雙 3090):GLM 5.3 Q3KXL 約 10 t/s,DS Flash Q4KXL 能到 25-30。
- @Philpax(Threadripper 3960X + 雙 3090 + 256GB DDR4):GLM-5.2 2-bit quant 最快 8 TPS,純 CPU 4-bit「大概變成 seconds-per-token」。
- @snerbles(2014 年雙 Xeon E5-2698 v4 + 512GiB):GLM-5.2 Q4 只有 0.8–1.1 tok/s,笑稱「對一台十年前的老古董來說,能跑就夠荒謬了」。
- @springtimesun 提醒坑:DDR5 頂到 10 tok/s,記憶體約 74°C 就開始軟節流。
- MoE offloading 的結論是「救不了」——200GB 的量化檔配 48GB VRAM,CPU/RAM 瓶頸難以克服。
四、該不該開放舊模型(GPT-3 之爭)
一位 @nkmnz 挑釁式問 Sam Altman:「2026 年了,江湖還說太危險不該公開 GPT-3,你到底在想什麼?」引爆一串歷史文物之爭:
- @futureshock 主張 GPT-3 是「重要的歷史文件、人類集體心智的時間膠囊」。@cptcobalt 則感傷「我懷念 davinci 的創作火花」,還有人附和「看到 davinci 這字眼都笑了」。
- 反方 @Philpax 理性列舉不宜釋出:極易萃取訓練資料助長訴訟、舊模型沒做安全強化易誘出危險行為、可能洩漏架構秘密。
- @includenotfound 最不客氣:「這些安全理由完全不可信,就是行銷。」——「現在我在本地跑幾個 AI 幫我做安全掃描,它們真的找出我 localhost server 上的 RCE(第三方 JWT library 的 account takeover)。他們的『beliefs』就只是行銷。」
- @seizethecheese 引《The Thinking Game》反駁:當年更笨的模型反而更危險(容易誘騙),Dario 因此推動 10x 規模化讓模型更安全。@gruez 一句話收尾:「GPT-3 已經被 gpt-oss 全面超越,開放它幹嘛?」
五、安全 vs 行銷:Emergent Cyber 的震撼
- @hkalbasi 表達擔憂:「怕我們還沒準備好迎接一個高網路安全能力的 open-weight 模型。」
- @0xbadcafebee 直接潑冷水:「太遲了,貓已經出袋。這就像怕從青銅時代進到鐵器時代——但全世界已經會煉鐵了,原料到處都是,人們已經在鑄鐵矛。我們需要的是造鐵盾。」他主張「全球每支軟體都該先被高強度安全模型掃過才能釋出」。
- @matheusmoreira 支持:「我恨不得把這些模型指向我自己的電腦,把我所有東西都硬化。美國大廠的守門行為正在積極助長電腦不安全。」
- @includenotfound 補刀:「沒用的模型是很安全,但今天這些模型都能示範 RCE 了。」
六、GLM-5.3 Flash 的定價與速度爭議
- @m00dy 說「Flash 比 DeepSeek 便宜、又更好,但沒人談」;@scosman 反駁:「其實稍貴($0.50 vs $0.48),只是暫時 50% 折扣。」
- 多人抱怨 速度慢:@_aavaa_「一點都不 flash」、@JoeLee1991「有時真的慢到不行、速度很不穩」、@esafak「透過 z.ai 很慢」。@scosman 解釋 z.ai 的 Flash 全用中國硬體,其他 provider(如 BaseTen)可到 100+ t/s。
- @0xbadcafebee 爆了一個料:「Stealth Ox-Alpha 其實就是 GLM-5.3-Flash,Ox-Alpha 是超強 coder(遠勝 DS4Flash)。有了 5.3 跟 5.3 Flash,我不需要更好的編碼模型了——現在要的是更快,不是更好。」
- @mlnj 一句話總結一群人的感受:「去年 12 月開始只用 GLM 系列,體驗最好,完全沒有 token 跟地緣政治的 drama。」
一句話總結
GLM-5.3 再次證明「開源已經好到足以撼動封閉大廠」,但這次真正的分歧不在「模型強不強」,而在「你願不願意為了掌控權、隱私、離線彈性去砸硬體」。而中國團隊用「同基底、純後訓練」就把 coding 和網路安全推上開源頂點,讓美國大廠的定價與安全說詞,都更難自圓其說了。