GLM-5.3 開源權重推出:Model Card 重點 + Hacker News 熱議整理

智譜 AI 釋出 GLM-5.3 開源權重,HN 上衝上熱門討論。這篇整理 Model Card 重點(同基底純後訓練、Coding 與 Emergent Cyber 兩大賣點)加上 200 多則留言的爭論核心:本地硬體值不值得買、5.3 Flash 評價、該不該開放舊模型、Emergent Cyber 的安全之爭。

智譜 AI(Z.ai)在 8 月 29 日釋出 GLM-5.3 的開源權重,Hacker News 上立刻以 585 分、204 則留言衝上當日熱門第 15 名。發文者只丟了一張 Hugging Face Model Card 和一則部落格連結,結果引爆的討論遠比 benchmark 數字本身更熱——本地硬體值不值得買、開源權重追近封閉大廠、舊模型該不該開放、以及那個「Emergent Cyber Capability」的安全爭議。這篇幫你把 Model Card 重點跟 200 多則留言的爭論一併整理好。

GLM-5.3 Model Card 重點

開宗明義一個關鍵:GLM-5.3 跟 GLM-5.2 用的是同一個 base model,所有進步全部來自 post-training。換言之,這不是一次大改架構,而是一次「後訓練煉金術」的展示。Model Card 上只提兩大賣點:

  • 更強的 Coding:號稱是「最強 open-weights 編碼模型」,在自家 Z.ai Code Bench 上比 GLM-5.2 提升 50%;並在公開 benchmark(Terminal Bench 3.0、Agents’ Last Exam)拿下 open-source SOTA。
  • Emergent Cyber Capability(湧現的網路安全能力):後訓練規模往上堆時,網路安全能力成長得比預期快。CyberGym 拿到 SOTA,而且在 exploitation(漏洞利用)鏈上越往上提升越大——比 GLM-5.2 幾乎翻倍。

規格方面:753B 參數,routed experts 這次預設改為 FP8(5.2 是 BF16),所以未量化版本約 756GB、差不多是 5.2(約 1.51TB)的一半,下載時間直接砍半——HN 上有人因此很興奮。另外支援 reasoning_effort(low / high / max,預設 max),對話場景要記得傳 clear_thinking=true

重點 Benchmark(精簡版)

Benchmark GLM-5.3 GLM-5.2 Kimi K3 DeepSeek V4 Opus 4.8
Terminal Bench 3.0 28.3 4.6 17.4 21.1
DeepSWE 66.9 46.2 67.5 62.7 58.0
FrontierSWE 78.1 67.5 66.5
SWE-Marathon 42.5 19.4 48.1 48.8
CyberGym 84.5 77.2 80.0 83.3 78.1
ExploitBench 54.4 24.4 32.2 28.8 40.0
GDPval-AA v2 1769 1508 1682 1590 1588

看點:Terminal Bench 3.0 一口氣從 4.6 拉上 28.3,直接把閉源的 Kimi 也甩開;CyberGym 全面壓過所有比較對象;ExploitBench 幾乎是 5.2 的兩倍多——「湧現的網路安全能力」不是喊假的。

Hacker News 社群在吵什麼

一、本地硬體值不值得買(最大主線)

多數留言先給出實際評測,但 200 多則裡最熱的話題是「要不要砸重金買硬體在家跑模型」,兩派互不相讓:

  • 反方(雲端永遠更划算):@rkangel 說純為省錢買硬體「絕對不值得」,開源模型的雲端規模效應讓回本期長達約十年。@SwellJoe 買了 Strix Halo + 雙 32GB GPU 現在閒置,「德州 110°F 的電費和散熱錢就吃光任何省下的錢」。@loglog 補刀:如果閉源服務「該」漲到四千鎂,你自架反而花更多,因為家用硬體永遠更沒效率。@Gigachad 更直接:「self-hosting 根本是 terrible deal,API 跟自架的價差大到無法無視。」
  • 正方(own the stack):@jaggederest 是代表,「最大的理由是擁有自己的 stack,這樣模型不能在你腳底下被換掉」——還反問「如果網路消失了呢?」@sneak 自封「數位末日準備者」,Mac Studio 512GB 花 $15k 也覺得值得。@Phemist 把話講得最白:「這是在擺脫與匿名雲端公司日漸敵對的關係——浮水印、靜默降級、隨機拒絕、停擺、改版 ToS、還有廣告。有自己的硬體,就沒有這個心理負擔了。」
  • 中間派:@colingauvin 用數據說硬體價值會隨時間增長——他買 Sparks 時只能跑 GPT-OSS-120B(AA 分 24),現在能跑 GLM 5.3 Flash Q4(AA 分 57)「價值漲了好幾倍」。@Aurornis 建議「兩年後再買二手更划算,市場上已經開始有人清倉了」。

二、GLM-5.3 與 5.3 Flash 的實戰評價

  • @revolvingthrow 稱它「想超越 DeepSeek Flash 或新 GLM Flash 時的最佳開源甜點位,能力略遜 Kimi 但好跑非常多」。
  • @mmastrac(評 5.3 Flash):「DS4Flash 不錯但不夠好,GLM-5.3 滿驚人的,我丟給它的難題都能接住,而且有 DS4Flash 沒有的直覺。」
  • @crossroadsguy 較保留:「推理還有很大改進空間」,但很擅長「可靠的苦力活」,只是寫 prose 很差、幾乎調不動它的習慣、偏見與過熱情。
  • @scosman 一句話引爆回響:「用起來就像 Opus 4.8,是最好的那種。」還有人接龍「比 Opus 5 好多了」。
  • 有趣的分歧:@redox99 說他反而更喜歡 5.3 Flash 而非 5.3——「5.3 沒有 vision 是致命傷,而且 Flash 做漂亮 UI 更在行。」

三、硬體實測:tok/s 數據交流

  • @lnenad(Epyc 48c 7643 + 雙 3090):GLM 5.3 Q3KXL 約 10 t/s,DS Flash Q4KXL 能到 25-30。
  • @Philpax(Threadripper 3960X + 雙 3090 + 256GB DDR4):GLM-5.2 2-bit quant 最快 8 TPS,純 CPU 4-bit「大概變成 seconds-per-token」。
  • @snerbles(2014 年雙 Xeon E5-2698 v4 + 512GiB):GLM-5.2 Q4 只有 0.8–1.1 tok/s,笑稱「對一台十年前的老古董來說,能跑就夠荒謬了」。
  • @springtimesun 提醒坑:DDR5 頂到 10 tok/s,記憶體約 74°C 就開始軟節流
  • MoE offloading 的結論是「救不了」——200GB 的量化檔配 48GB VRAM,CPU/RAM 瓶頸難以克服。

四、該不該開放舊模型(GPT-3 之爭)

一位 @nkmnz 挑釁式問 Sam Altman:「2026 年了,江湖還說太危險不該公開 GPT-3,你到底在想什麼?」引爆一串歷史文物之爭:

  • @futureshock 主張 GPT-3 是「重要的歷史文件、人類集體心智的時間膠囊」。@cptcobalt 則感傷「我懷念 davinci 的創作火花」,還有人附和「看到 davinci 這字眼都笑了」。
  • 反方 @Philpax 理性列舉不宜釋出:極易萃取訓練資料助長訴訟、舊模型沒做安全強化易誘出危險行為、可能洩漏架構秘密。
  • @includenotfound 最不客氣:「這些安全理由完全不可信,就是行銷。」——「現在我在本地跑幾個 AI 幫我做安全掃描,它們真的找出我 localhost server 上的 RCE(第三方 JWT library 的 account takeover)。他們的『beliefs』就只是行銷。」
  • @seizethecheese 引《The Thinking Game》反駁:當年更笨的模型反而更危險(容易誘騙),Dario 因此推動 10x 規模化讓模型更安全。@gruez 一句話收尾:「GPT-3 已經被 gpt-oss 全面超越,開放它幹嘛?」

五、安全 vs 行銷:Emergent Cyber 的震撼

  • @hkalbasi 表達擔憂:「怕我們還沒準備好迎接一個高網路安全能力的 open-weight 模型。」
  • @0xbadcafebee 直接潑冷水:「太遲了,貓已經出袋。這就像怕從青銅時代進到鐵器時代——但全世界已經會煉鐵了,原料到處都是,人們已經在鑄鐵矛。我們需要的是造鐵盾。」他主張「全球每支軟體都該先被高強度安全模型掃過才能釋出」。
  • @matheusmoreira 支持:「我恨不得把這些模型指向我自己的電腦,把我所有東西都硬化。美國大廠的守門行為正在積極助長電腦不安全。」
  • @includenotfound 補刀:「沒用的模型是很安全,但今天這些模型都能示範 RCE 了。」

六、GLM-5.3 Flash 的定價與速度爭議

  • @m00dy 說「Flash 比 DeepSeek 便宜、又更好,但沒人談」;@scosman 反駁:「其實稍貴($0.50 vs $0.48),只是暫時 50% 折扣。」
  • 多人抱怨 速度慢:@_aavaa_「一點都不 flash」、@JoeLee1991「有時真的慢到不行、速度很不穩」、@esafak「透過 z.ai 很慢」。@scosman 解釋 z.ai 的 Flash 全用中國硬體,其他 provider(如 BaseTen)可到 100+ t/s。
  • @0xbadcafebee 爆了一個料:「Stealth Ox-Alpha 其實就是 GLM-5.3-Flash,Ox-Alpha 是超強 coder(遠勝 DS4Flash)。有了 5.3 跟 5.3 Flash,我不需要更好的編碼模型了——現在要的是更快,不是更好。」
  • @mlnj 一句話總結一群人的感受:「去年 12 月開始只用 GLM 系列,體驗最好,完全沒有 token 跟地緣政治的 drama。」

一句話總結

GLM-5.3 再次證明「開源已經好到足以撼動封閉大廠」,但這次真正的分歧不在「模型強不強」,而在「你願不願意為了掌控權、隱私、離線彈性去砸硬體」。而中國團隊用「同基底、純後訓練」就把 coding 和網路安全推上開源頂點,讓美國大廠的定價與安全說詞,都更難自圓其說了。

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *