一句話先講完:Beam 論規格很能打,論成績沒贏,HN 留言近八成在吐槽,真正能賣的大概只有「非中國」三個字。
Beam 是什麼
Reflection 上週丟出 Beam,號稱自家第一款開放權重模型。重點規格如下:
| 項目 | 數字 |
|---|---|
| 架構 | 稀疏 MoE,總參數 501B,每 token 啟動 23B |
| 預訓練 | 23.8 兆 token,網頁加上專有授權資料 |
| RL | 10,500 張 GB300 跑四週,超過一億次 rollout |
| 上下文 | 訓練 256K,Midtraining 拉到 1M |
| 授權 | 這個月以 Apache 2.0 放出權重 |
| 現況 | 最終 red-teaming,先開放登記,權重還沒上架 |
預訓練不到四週燒完,6,144 張 GB300 NVL72,goodput 做到 92.3%。光是這份工程執行力就值得看一眼,不管最後分數如何。
成績:效率是亮點,絕對值沒贏
Beam 主攻程式與 agent 任務,官方說法是「每 token 智商更高」。攤開數字看:
| 評測 | Beam | 最強對手 | 差距 |
|---|---|---|---|
| Terminal Bench 2.1 | 80.1 | DeepSeek V4.1 Flash 90.6 | 落後一截 |
| SWE Bench Pro v2-Hard | 77.2 | Kimi K3 88.2 | 中段班 |
| DeepSWE v1.1 | 44.4 | DeepSeek V4.1 Flash 74.2 | 被海放 |
| AIME 2026 | 97.8 | GLM 5.2 99.2 | 有得拚 |
| HLE 無工具 | 36.2 | Kimi K3 46.9 | 中段 |
官方真正站得住腳的主張只有一個:拿到跟 GLM-5.2 相近的分數,推論算力只要三分之一到四分之一。對要省錢跑程式 agent 的企業,這句話有吸引力。對只看榜首的人,這張成績單不夠看。
HN 反應:八成在吐槽
討論串開了一小時就破百點,三十多則留言,風向很一致:肯定多一個開放權重,但公告本身被罵翻。我按留言整理成幾派:
| 派別 | 聲量 | 代表說法 |
|---|---|---|
| 空公告派 | 最大聲 | 沒權重、沒 HF repo、沒技術細節,先別吹 |
| 又大又貴又輸派 | 第二大 | 參數比 DeepSeek V4.1 Flash 大,更貴,每項都輸 |
| 圖表誤導派 | 不小 | 強的對手藏在摺疊後面,圖只放打得贏的 |
| Demo 翻車派 | 有料 | 陸水謎題號稱幾天前的新梗,2025 年 8 月 LessWrong 就有了 |
| 賣非中國派 | 一針見血 | 靠「非中國」三個字,搶禁用外國模型的政府標案 |
| 歡迎新玩家派 | 少數 | 多一個開放權重總是好事 |
罵最兇的一句來自 halJordan,大意是:用更多算力、更多資料,還超不過前人,那叫訓練方法不如人,不該鼓勵。這話狠,但數字站在他那邊。
去中敘事,第三次上演
整篇公告我印象最深的不是分數,是這句:「Beam advances the Western open-weight frontier」。HN 的 swiftcoder 直接戳破:賣點就是「我們不是中國實驗室」。底下立刻有人補上 Reflection 的融資敘事:American DeepSeek,背後是 Nvidia、Eric Schmidt、Sequoia,TechCrunch 報過募了 20 億美元。
這套敘事我已經看過太多次:先是歐洲主權 AI,再來各國主權模型,現在輪到美國版 DeepSeek。技術差距用國籍補,榜單輸了用法遵贏。政府合約確實有禁用外國模型的需求,這門生意存在,我不否認。但把「不是中國做的」當成本體去賣,模型本身反而變成配角,就有點可惜了那 10,500 張 GB300。
我的看法
Beam 值得追,但不是現在。等三樣東西:權重、技術報告、第三方實測。效率路線如果是真的,企業導入會有位置,畢竟不是每個任務都需要榜首,便宜又夠用才是大多數公司的日常。至於去中敘事,聽聽就好,採購可以看法遵,工程師還是看分數和帳單。
我把公告全文翻譯和 HN 留言整理做成一頁圖表版:Beam 501B 故事線。原文連結:Reflection 官方公告、HN 討論串。
圖表版
手機看不到內嵌頁時,直接開:Beam 501B 故事線
