Qwen3.8-Flash-Next:Qwen4 的架構預覽,把訓練成本打到 1/9

阿里 Qwen 無預警開源 Qwen3.8-Flash-Next,config 裡直接寫著 qwen4_exp。GDN 加 QSA 稀疏注意力、四分支 residual stream、51B N-gram 查表記憶體、Muon optimizer,訓練成本宣稱只要前代的九分之一。定價 $0.16/M tokens,但授權不是 Apache 2.0。

阿里 Qwen 團隊 8 月 26 日無預警開源了 Qwen3.8-Flash-Next。名字唸起來很拗口,但它的角色非常清楚:這就是 Qwen4 的架構預覽版。官方自己說得很直白,當年 Qwen3-Next 先把 Gated DeltaNet 加 Attention 的混合架構丟出來,之後 Qwen3.5、3.6、3.7、3.8 整個系列都吃了這套設計;現在同樣的劇本再演一次,先把 Qwen4 要用的架構釋出讓社群檢驗,feedback 收完再蓋正式家族。我在 config 裡看到 model_type 直接寫著 qwen4_exp,這大概是最不加掩飾的暗示了。

規格一句話講完:125B 總參數的 MoE,每個 token 只激活 6B,另外掛一張 51B 的 N-gram embedding 大表。原生 context 262K,YaRN 可以拉到 1M,帶視覺理解。宣稱訓練成本只有 Qwen3.7-Plus 的九分之一。

注意力:GDN 加上新的 QSA

沿用舊配方:每四層裡三層是 Gated DeltaNet,把歷史資訊持續壓進固定大小的 state,省 KV cache;剩下留一層 full attention 負責精確檢索。真正的新東西是 Qwen Sparse Attention(QSA)。稀疏注意力的老毛病是,那個負責挑重要 token 的 indexer 自己也會隨著 context 變長而變貴,DeepSeek V3.2 的 DSA 是 token 級索引,已經算是便宜的了。QSA 再往下壓:先把序列聚合成 micro-blocks,在塊的層級估重要性再選區域,而且每一層獨立做壓縮,不去賭跨層相似度這種假設。官方數字是 1M tokens 下 prefill 快 7.6 倍、decode 快 4.9 倍。

Residual stream 從單行道變四線道

Gated Residual 把原本所有層共用的那條 residual stream 拆成四條分支,讀和寫各有動態門控控制。有個細節我蠻喜歡:他們實際訓練下去觀察,發現其中一條分支自然演化成「第一層 attention 直通大多數中後層」的長程通道。不是誰設計的,是自己長出來的。另外殘差狀態支援用 FP8 存,省的是記憶體頻寬而不是算力。

N-gram embedding:51B 參數幾乎不花計算

這招學自 Gemma 3n 的 Per-Layer Embedding 和 DeepSeek Engram:用當前 token 加上前面幾個 token 組成的局部片段去查一張大表,給常見短語額外的表示能力。關鍵在於查表位置可以事先算好,所以這 51B 參數可以整張丟在主機記憶體、和 GPU 上的計算非同步 prefetch,不進矩陣乘法的預算。代價是推理框架必須支援這個 offload:vLLM 要開 VLLM_PLE_CPU_OFFLOAD=1,llama.cpp 陣營到目前為止還在等 NVMe offload 功能落地。

Muon optimizer 正式上大桌

訓練主力換成 Muon,分工是 attention、GDN、MoE expert 這類二維權重矩陣走 Muon,embedding、router、低秩參數留在 AdamW。順帶一提,Thinking Machines 的 Inkling 和 Cognition 的 SWE-1.7 也都用 Muon,這個 optimizer 大規模實戰化的趨勢很明顯了。論文裡有個反直覺的實驗結果:大家習以為常的 batch size warmup,在這套配方下反而要多花 18.8% 的 optimizer steps,最終訓練直接從目標 batch size 開跑。

成績單,照例打折看

官方表格裡 agentic coding 和 office 任務全面贏過 DeepSeek-V4-Flash(284B 參數、13B active)和 Claude Opus 4.6 Max。少數輸的項目是 HLE,35.9 對 Claude 的 40。提醒一下,CoWorkBench 和 JobBench 都是 Qwen 自家的 in-house benchmark,第三方複驗還沒跟上,數字看看就好,等社群實測再下結論。

Benchmark Qwen3.8-Flash-Next DeepSeek-V4-Flash Claude Opus 4.6 Max
SWE-bench Pro 62.5 56.0 53.4
SWE-bench Multilingual 81.0 77.5
CoWorkBench 73.9 45.1 68.2
JobBench 55.7 41.3 36.6
Toolathlon Verified 73.5 70.3
GPQA Diamond 91.7 90.8 91.3
HLE 35.9 33.8 40.0

定價便宜得誇張,授權卻要看清楚

產品版 Qwen3.8-Flash 定價每百萬輸入 $0.16、輸出 $0.47,API 目前還在路上。權重這邊有個很多人第一天就踩到的點:不是 Apache 2.0,是 Qwen Community License 1.0。月活躍用戶超過一億、或月營收超過兩千萬美元的產品,要在介面上展示模型名稱;做 MaaS 或 AI 工作助手業務則要另外談授權。個人本地使用完全不受影響。這跟 Qwen3.8-27B 的 Apache 2.0 不一樣,Reddit 上第一時間就有人挖出來了。

本地跑得動嗎?

Unsloth 第一天就出了 GGUF,UD-Q4_K_XL 共 111GB、最低的 IQ1_S 也要 72.5GB。社群速度很快:有人拿 128GB MacBook Pro 跑 Q4_XS 得到每秒 29.7 tokens;Strix Halo 上 22 tokens/s,品質被評為勝過 Qwen3.8-27B;有 512GB RAM 工作站的人用兩張 RTX PRO 6000 跑 FP8 開到 124 tokens/s。共同的瓶頸都是那張 51B 的 n-gram 表。論壇上最有共識的願望清單第一名,就是 llama.cpp 支援表的 NVMe offload,哪天做成了,sparse KV 加上表外置,中階機器就有機會玩。

我的看法

兩件事值得記住。第一,qwen4_exp 這個代號意味著整個 Qwen4 家族都會蓋在這套積木上,現在看懂 GDN、QSA、Gated Residual、N-gram 這四件組合,等於提前拿到了 Qwen4 的設計圖。第二,「參數量和計算量脫鉤」這條路線開始成形,DeepSeek 用 ultra-sparse MoE 卷,Qwen 更進一步加了 lookup 式的大記憶體,兩家都在證明總參數不再等於帳單。

Hacker News 上也有人唱反調,覺得 Flash 這種效率型模型是演化死路:大模型火力全開跑三十分鐘解決問題,好過小模型掙扎兩小時還產出一堆要返工的程式碼,race-to-idle 才划算。這個批評本身沒錯,但它的前提是你付得起大模型的帳。$0.16 每 M tokens 的定價,顯然不是為那種場景服務的。

連結

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *