四十八個德瑞克

Ox Alpha 真面目揭曉:一款神秘免費模型,怎麼被鄉民七天內驗明正身

Ox Alpha 真面目揭曉:一款神秘免費模型,怎麼被鄉民七天內驗明正身

上週(8 月 20 日)OpenRouter 上悄悄出現一款匿名模型,叫做 Ox Alpha。供應商欄位只寫「Stealth」,規格卻絲毫不含糊:一百萬 token 的 context window、可以吃圖片和影片、完全免費,頁面上還宣稱每天有 100 兆 token 的服務量能。沒人知道是誰做的。

六天後的今天(8 月 26 日),Z.ai 向 Bloomberg 證實:Ox Alpha 就是 GLM-5.3-Flash,而且今晚開源權重。免費試用期原本就設定到 8 月 27 日左右,收得剛剛好。

這一個星期發生的事情,比模型本身精彩。

一款「根本不像 flash」的 flash 模型

引爆點是 8 月 21 日。開發者 Ben Davis 把這款免費模型丟進 DeepSWE(長程軟體工程 benchmark)測了 10 題,結果:

他自己都寫說「I am very confused」。一款來路不明、還免費的模型,把兩家美國頂級旗艦踩過去?Stripe 執行長 Patrick Collison 試用後也公開說非常令人印象深刻。才三天,Ox Alpha 就擠進 OpenRouter 週用量榜前段班,旁邊都是 DeepSeek、小米 MiMo 這種已經具名的模型。

不過理性派的質疑也對:10 題的子集,跑分就是會飄。後續有人用更大的子集重測,成績落在 63% 左右,完整跑分約 58.4%,大約是貼著 Opus 4.8 的水準。很強,但不是屠榜。當初喊「贏過 Fable」的人,揭曉之後果然集體改口「其實就是 Opus 4.8 等級啦」。

社群鑑識課:不用權重也能查出戶籍

真正有趣的是抓身份的過程。這幾年社群已經發展出一套標準化的「模型指紋術」,這次全套上陣:

  1. Tokenizer 對齊:拿六種語言的文本去算 prompt_tokens,Ox Alpha 和 GLM-5.3 每一題都完全一致,而且是固定 +75(多出來的是隱藏 system prompt)。Kimi、Qwen、MiMo、MiniMax 全部偏離。
  2. 錯誤訊息:故意傳錯參數,它回 [1210] This model always engages in thinking...,跟 GLM-5.3 的錯誤字串一模一樣。更狠的玩法是送 malformed request 騙它吐出智譜內部的 Java stack trace。
  3. Temp-0 輸出比對:溫度歸零讓輸出變成確定性,同樣的 prompt 得到近乎逐字相同的回答,連德式小數的 LaTeX 寫法怪癖(0{,}375)都複製貼上。
  4. modelprint 九項探針:開源工具 modelprint 對九項基礎設施特徵做掃描,GLM 家族拿下 tokenizer 四組全中,其他實驗室最好的成績只有兩組。
  5. 中文圈情報:有人翻到內部代號 GLM-5.3-t;API 回錯誤碼 1214 代表「模型不存在」、1210/1220 代表「存在但鎖權限」,證明系統裡早就有這個條目,只是暫時上鎖。

三條線索殊途同歸,r/opencode 上有人下了結論:「yeah this mystery is cooked」(這謎底煮熟了)。

身份確認最大的障礙反而是一個簡單的事實:公開版 GLM-5.3 是純文字模型,Ox Alpha 卻會看圖片和影片。所以 Hacker News 上有人押 Kimi K3.5(因為延遲跟 Moonshot 吻合),Reddit 上則是各種陰謀論滿天飛。

Google 員工帶風向事故

8 月 22 日,Google DeepMind 員工 Evan Otero 發了一則推文,正文只有一個詞:「Gemini」。接著補一句「What if the Ox Alpha was the friends we made along the way」,破百萬觀看。

效果立竿見影,社群開始分裂。r/singularity 出現一篇 280 分的帖子「DeepMind Researcher Strongly Hints Ox Alpha Is The Next Gemini Pro Model」,底下吵成一團。但冷靜的反駁一直在:

同一時間,另一篇 387 分的帖子標題更直接:「Ox Alpha can’t be the Chinese.」事後看很好笑,因為大家早就知道是 GLM 了,只是這篇在賭審查行為代表西方模型。揭曉之後,r/singularity 最高讚的留言是在罵 DeepMind:「wtf were those delusional posts by pretty high ranking deepmind guys? Have they gone insane?」

最有先見之明的預言來自 u/thepetek,他在結果出來前就寫:「等這些人知道是小型中國模型,他們馬上就會改口說只是 Opus 4.8 等級。」一字不差命中。

揭曉之後:評價瞬間重校準

今天是結案日,反應大致分成幾派:

技術圈(興奮):GLM-5.3-Flash 是原生視覺模型,官方部落格暗示 380B 參數會開放權重。r/singularity 有人說「原生視覺才是這條新聞的重點,不是分數」。如果能像 GLM-4.7 Flash 一樣本地部署,那就是免費的自建旗艦。成本效率直接帳面很漂亮:Opus 4.8 效果相近,單價卻貴好幾倍。

使用者(愛恨交織):r/opencode 口碑兩極。有人說「修 bug 比DeepSeek V4 有創意」、有人抱怨「最慢的 flash 模型」(全球灌爆嘛)、「跑到一半自己 quit」。過渡期結束,OpenCode Go 已經改成雙倍用量照常供應。

隱私派(毛毛的):免費 100 兆 token 是圖什麼?OpenRouter 的頁面寫「供應商留存你的 prompt」,OpenCode 的文件卻寫「零留存」,同一個模型兩種說法。最高讚留言是警世文:「中國習慣用科技吸走大量有價值的數據。這東西免費又接近頂級,我們這些窮鬼會毫不猶豫地跳上去做大事。」你的私有 repo 可能在餵別人的下一輪訓練。

三件值得記住的事

第一,stealth 模型已經是中國實驗室的固定套路。OpenRouter 這一系列的匿名模型,Pony Alpha 後來變成 GLM-5、Hunter Alpha 變成 MiMo-V2-Pro、Owl Alpha 變成 LongCat-2.0,加上這次的 Ox Alpha,每一款最後都由中國實驗室認領。免費期收割真實工作負載加曝光度,模板完全一致。

第二,行為審查法已死,基礎設施指紋學是王道。問模型台灣首都可以得到任何答案(審查掛在平台層,不在權重裡),但 tokenizer 的 token 數和錯誤字串騙不了人。unclecode 的但書「Same fingerprint proves shared infrastructure, not shared identity」 這句但書依然成立,但這次連 stack trace 都吐了。

第三,benchmark 分數要搭配標籤解讀。80% 的 DeepSWE 子集在「神秘新旗艦」身上是震撼彈,在「flash 小模型」身上變成「噢 Opus 4.8 等級也不錯啊」。分數一動沒動,換個牌子整個社群的感受重新洗牌。下次看到神秘模型跑分爆炸,先想清楚自己的興奮有多少是真的來自能力,多少來自故事。


參考資料:Z.ai 官方公告r/singularity 指紋分析Ben Davis 的 DeepSWE 測試Techmeme 彙整inside.com.tw 報導

Exit mobile version