TL;DR
騰訊 8/28 發布並開源 Hy4 preview:770B MoE(激活 49B)、1M context、Apache 2.0 無限制授權。Benchmark 是全部廠商自測、零第三方復現,但 OpenRouter 三天衝進日榜前四(~4T tokens)、r/LocalLLaMA 官方 200GB GGUF 量化帖 878 up——社群對「價格 + 開源權重 + agent 編碼」三張牌的熱情,遠高於對跑分的信任。
一、基本盤
| 項目 | 內容 |
|---|---|
| 架構 | MoE,總參數 770B / 激活 49B(78 層,256 路由專家 + 1 共享專家,top-8) |
| 內建 MTP | 投機解碼層(10B 總 / 0.7B 激活);HF 檔案頁 780B 是含這層的數字 |
| 上下文 | 1,048,576 tokens;注意力為 Gated DSA(官方承認借鑑 DeepSeek / GLM) |
| License | Apache 2.0,無 MAU 門檻、無 field-of-use 條款(早期混元不是這樣) |
| 權重 | HF / ModelScope / GitCode / CNB;BF16 約 1.56TB,另有官方 FP8 變體 |
| 模態 | 純文字,無 vision(正式版補) |
| API 價格 | ¥6 輸入 / ¥18 輸出 / ¥0.3 快取命中(每百萬 tokens);OpenRouter 同價 $0.834 / $2.501 / $0.042 |
| 部署 | Day-zero vLLM(PR #54160,0.29.0+)與 SGLang 官方 Docker;FP8 約需 8×H200 單節點 |
二、Benchmark:世代躍進為真,但請先當宣傳看
以下全部是騰訊自測,競品分數多數也是騰訊自己復跑的(官方在方法學備註里誠實標了星號)。
| Benchmark | Hy3 | Hy4 preview | 最強競品(騰訊口徑) |
|---|---|---|---|
| DeepSWE | 28.0 | 64.3 | GPT-5.6 Sol 72.7 |
| Terminal-Bench 2.1 | 70.8 | 85.4 | Kimi K3 88.3 / GLM-5.3 88.2 |
| SWE-bench Multilingual | 75.8 | 82.9 | Claude Opus 5 89.5 |
| SWE-bench Pro | 57.9 | 65.7 | Claude Opus 5 79.2 |
| SWE Marathon | 5.0 | 31.9 | — |
| CritPt(物理推理) | 4.9 | 16.9 | GPT-5.6 Sol 32.3 |
| OneMillionBench (w/ tools) | 51.5 | 65.4(開源第一) | — |
| CyberGym | 51.8 | 78.4 | GLM-5.3 84.5 |
| GPQA Diamond | 90.9 | 92.3 | 全場 91.7–94.7(已飽和) |
| HLE(無工具 / 有工具) | 34.4 | 43.4 / 55.4 | Claude Opus 5 54.9 |
| Toolathlon-Verified | — | 74.1 | 宣稱勝 GPT-5.6 Sol、Qwen 3.8 Max |
| APEX-Agents pass@1 | — | 37.1 | Kimi K3 37.2(差 0.1) |
| MathArena Apex 2025 | 38.7 | 74.2 | GPT-5.6 Sol 90 / Opus 5 91.4 |
定位解讀:
- 對開源同儕:與 Qwen 3.8 Max、GLM-5.3、Kimi K3、DeepSeek V4 Pro 互有勝負,不是全面壓制——SWE-bench 系列領先,但 Terminal-Bench、ProgramBench、DeepSWE 反被 GLM / Kimi / DeepSeek 超。
- 對閉源前沿:一致落後 GPT-5.6 Sol / Claude Opus 5,差距最大在純推理(CritPt、HLE、MathArena)。
- 內部盲測:163 位騰訊專家 × 203 工程任務,2.99/4,「略勝」GLM-5.3(2.92)與 Kimi K3(2.94)。勝率只有 46–51%,自己跑的評測、差距小到接近平手。
⚠️ 可信度:發布四天內 Artificial Analysis 未收錄、HF Leaderboard 無數據、無社群獨立復測,媒體報導清一色通稿轉述。騰訊自己也誠實列出 known limitations:思考過長、過度自我驗證(over-verification)。實測 P50 首 token 延遲約 3.2 秒、吞吐僅 36–38 tok/s,跑 agent 循環會明顯等。
三、社群反應
Reddit(r/LocalLLaMA 為戰場中心)
- 最熱帖是官方 MIX-STQ1_0 量化:1.5TB 壓到約 200GB GGUF、保留約 98% 效能(1.31-bit STQ1_0 與 2.06-bit IQ2_XXS 按校準逐層混用)——878 up / 142 則。社群口號是「本地模型的未來比預期亮」,但現實抱怨也到位:llama.cpp 還沒 merge、無 ROCm、200GB 一般人也跑不動(高讚梗:「只差 190GB 我的 RTX 3080 就能跑了」)。
- 量化老饕肯定手法紮實:「98% 若不是只測 KL divergence 而是實跑 benchmark,這數字就有意義」(這次有)。
- 另有 FlappyBench 自發對測(vs Kimi K3、GLM 5.3)、WorkBuddy $10 訂閱兩小時打限的抱怨、以及「Hy4 太受歡迎擠爆自家佇列」趣聞。
Hacker News(384 分 / 252 則)
- maximinir 的關鍵觀察:OpenRouter 幾天就處理數兆 tokens,超過 GLM-5.3 一週的量;快取命中只收 input 價的 5%(同儕 10–20%),對 agent 工作負載是殺手鐧。現況日榜第 4(~1.2T tokens/天)。
- 質疑聲集中三點:benchmark 圖表「chart crimes」(排序與高亮全護航自家)、open weights ≠ open source 的定義之爭、首週端點不穩(有人跑分一直 timeout)。
- Simon Willison 用招牌的「騎自行車鵜鶘 SVG」測試,發現 reasoning trace 用精簡英文省 token,引發一輪壓縮式推理的技術討論。
X.com
- 社群互動集中在官方量化帖(1,683 讚 / 34 萬瀏覽)而非發布帖本身。
- 廣傳的「Hy4 平行協調多個 Codex sessions、八項 benchmark 勝單干 Codex」出自騰訊自家敘事,無獨立驗證。
Hugging Face Discussions
12 篇 thread 多為 PR 性質。信號點:架構圈認為 mHC「有點進步,但不多」——Hy4 是工程堆疊取勝而非原創架構;「Qwen 和 GLM 都下到 300B 以下本地級了,這貨還是太大」反映社群對 770B 落地性的普遍態度。
四、結論
| 面向 | 共識 |
|---|---|
| 能力 | 世代增幅為真(DeepSWE 28→64),穩坐開源第一梯隊;但對 GLM-5.3 / Kimi K3 是「三巨頭平手」,對閉源前沿推理仍有明確差距 |
| 信任 | 100% 廠商自報、零第三方復現——所有分數先當宣傳看 |
| 熱度 | 真實:OpenRouter 三天 4T tokens 進日榜前四;Apache 2.0 無條款是社群最買帳的一點 |
| 硬傷 | 無 vision、over-verification 燒 token、36–38 tok/s 偏慢、首週可用性約 86%、OpenRouter 路由暫不支援 tools / response_format |
| 選型建議 | 值得用低價跑 shadow test,別接生產;等正式版 + 獨立評測。1M context + ¥0.3 快取命中對長 agent 循環的經濟性是目前最大亮點 |
一句話總結:Hy4 preview 是騰訊把「便宜 + 開源權重 + agent 編碼」三張牌同時打出的卡位之作。社群對價格和量化的熱情遠高於對 benchmark 的信任——分數等獨立復測,錢包可以現在試。
資料截至 2026-09-01。來源:GitHub、Hugging Face、OpenRouter、HN 討論串。
