四十八個德瑞克

騰訊 Hy4 preview 深度解析:Benchmark、社群反應與可信度總盤

TL;DR

騰訊 8/28 發布並開源 Hy4 preview:770B MoE(激活 49B)、1M context、Apache 2.0 無限制授權。Benchmark 是全部廠商自測、零第三方復現,但 OpenRouter 三天衝進日榜前四(~4T tokens)、r/LocalLLaMA 官方 200GB GGUF 量化帖 878 up——社群對「價格 + 開源權重 + agent 編碼」三張牌的熱情,遠高於對跑分的信任。

一、基本盤

項目 內容
架構 MoE,總參數 770B / 激活 49B(78 層,256 路由專家 + 1 共享專家,top-8)
內建 MTP 投機解碼層(10B 總 / 0.7B 激活);HF 檔案頁 780B 是含這層的數字
上下文 1,048,576 tokens;注意力為 Gated DSA(官方承認借鑑 DeepSeek / GLM)
License Apache 2.0,無 MAU 門檻、無 field-of-use 條款(早期混元不是這樣)
權重 HF / ModelScope / GitCode / CNB;BF16 約 1.56TB,另有官方 FP8 變體
模態 純文字,無 vision(正式版補)
API 價格 ¥6 輸入 / ¥18 輸出 / ¥0.3 快取命中(每百萬 tokens);OpenRouter 同價 $0.834 / $2.501 / $0.042
部署 Day-zero vLLM(PR #54160,0.29.0+)與 SGLang 官方 Docker;FP8 約需 8×H200 單節點

二、Benchmark:世代躍進為真,但請先當宣傳看

以下全部是騰訊自測,競品分數多數也是騰訊自己復跑的(官方在方法學備註里誠實標了星號)。

Benchmark Hy3 Hy4 preview 最強競品(騰訊口徑)
DeepSWE 28.0 64.3 GPT-5.6 Sol 72.7
Terminal-Bench 2.1 70.8 85.4 Kimi K3 88.3 / GLM-5.3 88.2
SWE-bench Multilingual 75.8 82.9 Claude Opus 5 89.5
SWE-bench Pro 57.9 65.7 Claude Opus 5 79.2
SWE Marathon 5.0 31.9
CritPt(物理推理) 4.9 16.9 GPT-5.6 Sol 32.3
OneMillionBench (w/ tools) 51.5 65.4(開源第一)
CyberGym 51.8 78.4 GLM-5.3 84.5
GPQA Diamond 90.9 92.3 全場 91.7–94.7(已飽和)
HLE(無工具 / 有工具) 34.4 43.4 / 55.4 Claude Opus 5 54.9
Toolathlon-Verified 74.1 宣稱勝 GPT-5.6 Sol、Qwen 3.8 Max
APEX-Agents pass@1 37.1 Kimi K3 37.2(差 0.1)
MathArena Apex 2025 38.7 74.2 GPT-5.6 Sol 90 / Opus 5 91.4

定位解讀:

⚠️ 可信度:發布四天內 Artificial Analysis 未收錄、HF Leaderboard 無數據、無社群獨立復測,媒體報導清一色通稿轉述。騰訊自己也誠實列出 known limitations:思考過長、過度自我驗證(over-verification)。實測 P50 首 token 延遲約 3.2 秒、吞吐僅 36–38 tok/s,跑 agent 循環會明顯等。

三、社群反應

Reddit(r/LocalLLaMA 為戰場中心)

Hacker News(384 分 / 252 則)

X.com

Hugging Face Discussions

12 篇 thread 多為 PR 性質。信號點:架構圈認為 mHC「有點進步,但不多」——Hy4 是工程堆疊取勝而非原創架構;「Qwen 和 GLM 都下到 300B 以下本地級了,這貨還是太大」反映社群對 770B 落地性的普遍態度。

四、結論

面向 共識
能力 世代增幅為真(DeepSWE 28→64),穩坐開源第一梯隊;但對 GLM-5.3 / Kimi K3 是「三巨頭平手」,對閉源前沿推理仍有明確差距
信任 100% 廠商自報、零第三方復現——所有分數先當宣傳看
熱度 真實:OpenRouter 三天 4T tokens 進日榜前四;Apache 2.0 無條款是社群最買帳的一點
硬傷 無 vision、over-verification 燒 token、36–38 tok/s 偏慢、首週可用性約 86%、OpenRouter 路由暫不支援 tools / response_format
選型建議 值得用低價跑 shadow test,別接生產;等正式版 + 獨立評測。1M context + ¥0.3 快取命中對長 agent 循環的經濟性是目前最大亮點

一句話總結:Hy4 preview 是騰訊把「便宜 + 開源權重 + agent 編碼」三張牌同時打出的卡位之作。社群對價格和量化的熱情遠高於對 benchmark 的信任——分數等獨立復測,錢包可以現在試。

資料截至 2026-09-01。來源:GitHubHugging FaceOpenRouterHN 討論串

Exit mobile version