Reflection 新模型登場,八成不看好:重複上演的去中敘事

Beam 規格很能打,成績沒贏,HN 近八成吐槽。真正能賣的大概只有非中國三個字。

一句話先講完:Beam 論規格很能打,論成績沒贏,HN 留言近八成在吐槽,真正能賣的大概只有「非中國」三個字。

Beam 是什麼

Reflection 上週丟出 Beam,號稱自家第一款開放權重模型。重點規格如下:

項目 數字
架構 稀疏 MoE,總參數 501B,每 token 啟動 23B
預訓練 23.8 兆 token,網頁加上專有授權資料
RL 10,500 張 GB300 跑四週,超過一億次 rollout
上下文 訓練 256K,Midtraining 拉到 1M
授權 這個月以 Apache 2.0 放出權重
現況 最終 red-teaming,先開放登記,權重還沒上架

預訓練不到四週燒完,6,144 張 GB300 NVL72,goodput 做到 92.3%。光是這份工程執行力就值得看一眼,不管最後分數如何。

成績:效率是亮點,絕對值沒贏

Beam 主攻程式與 agent 任務,官方說法是「每 token 智商更高」。攤開數字看:

評測 Beam 最強對手 差距
Terminal Bench 2.1 80.1 DeepSeek V4.1 Flash 90.6 落後一截
SWE Bench Pro v2-Hard 77.2 Kimi K3 88.2 中段班
DeepSWE v1.1 44.4 DeepSeek V4.1 Flash 74.2 被海放
AIME 2026 97.8 GLM 5.2 99.2 有得拚
HLE 無工具 36.2 Kimi K3 46.9 中段

官方真正站得住腳的主張只有一個:拿到跟 GLM-5.2 相近的分數,推論算力只要三分之一到四分之一。對要省錢跑程式 agent 的企業,這句話有吸引力。對只看榜首的人,這張成績單不夠看。

HN 反應:八成在吐槽

討論串開了一小時就破百點,三十多則留言,風向很一致:肯定多一個開放權重,但公告本身被罵翻。我按留言整理成幾派:

派別 聲量 代表說法
空公告派 最大聲 沒權重、沒 HF repo、沒技術細節,先別吹
又大又貴又輸派 第二大 參數比 DeepSeek V4.1 Flash 大,更貴,每項都輸
圖表誤導派 不小 強的對手藏在摺疊後面,圖只放打得贏的
Demo 翻車派 有料 陸水謎題號稱幾天前的新梗,2025 年 8 月 LessWrong 就有了
賣非中國派 一針見血 靠「非中國」三個字,搶禁用外國模型的政府標案
歡迎新玩家派 少數 多一個開放權重總是好事

罵最兇的一句來自 halJordan,大意是:用更多算力、更多資料,還超不過前人,那叫訓練方法不如人,不該鼓勵。這話狠,但數字站在他那邊。

去中敘事,第三次上演

整篇公告我印象最深的不是分數,是這句:「Beam advances the Western open-weight frontier」。HN 的 swiftcoder 直接戳破:賣點就是「我們不是中國實驗室」。底下立刻有人補上 Reflection 的融資敘事:American DeepSeek,背後是 Nvidia、Eric Schmidt、Sequoia,TechCrunch 報過募了 20 億美元。

這套敘事我已經看過太多次:先是歐洲主權 AI,再來各國主權模型,現在輪到美國版 DeepSeek。技術差距用國籍補,榜單輸了用法遵贏。政府合約確實有禁用外國模型的需求,這門生意存在,我不否認。但把「不是中國做的」當成本體去賣,模型本身反而變成配角,就有點可惜了那 10,500 張 GB300。

我的看法

Beam 值得追,但不是現在。等三樣東西:權重、技術報告、第三方實測。效率路線如果是真的,企業導入會有位置,畢竟不是每個任務都需要榜首,便宜又夠用才是大多數公司的日常。至於去中敘事,聽聽就好,採購可以看法遵,工程師還是看分數和帳單。

我把公告全文翻譯和 HN 留言整理做成一頁圖表版:Beam 501B 故事線。原文連結:Reflection 官方公告、HN 討論串。

圖表版

手機看不到內嵌頁時,直接開:Beam 501B 故事線

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *