四十八個德瑞克

小米 MiMo-V2.6 發布:兩款原生全模態開源模型,RL 訓練過程全程直播

抽象插畫:發光幾何核心向外散出四道彩色光帶,象徵文字、圖片、影片與音訊匯入同一模型

小米在 2026 年 9 月 22 日發布並開源 MiMo-V2.6 系列,包含 Pro、Flash 與 Pro-UltraSpeed 三款模型。這是小米在 RSI(遞迴式自我改進)路徑上的關鍵一步:把算力砸在可驗證的複雜任務上,讓模型透過強化學習的探索與回饋持續擴張能力邊界。

跑分當然要談,但這一版真正有意思的是另外兩點。一是小米第一次做出原生全模態的模型,二是他們把整段 RL 訓練過程連同成本、失敗紀錄一起直播給全世界看。

規格一次看

項目 MiMo-V2.6-Pro MiMo-V2.6-Flash
參數 1.02T 總/42B 激活 309B 總/15B 激活
層數(總/滑動視窗/全域) 70/60/10 48/39/9
上下文 1M tokens 1M tokens
模態 文字、圖片、影片、音訊 同左
授權 MIT MIT
API 輸入(未命中快取) $0.435 $0.14
API 輸出 $0.87 $0.28

第三款 Pro-UltraSpeed 是 Pro 的高速推論模式,宣稱輸出速度最高提升 20 倍,定價 $4.35 輸入、$8.7 輸出(每百萬 tokens)。API 模型名必須全小寫。

價格維持 V2.5 不變,等於同等價格拿到升級後的智慧。官方宣稱 Pro 在同等智慧水平下,價格只有海外模型的二十分之一到六十分之一。

全模態是這一版最大的斷代

前一代的 MiMo-V2.5-Pro 與更早的 MiMo-V2-Flash 都是純文字模型。V2.6 的 Pro 和 Flash 則是原生全模態,兩款共用同一組編碼器:

Backbone 本身變化不大,仍是稀疏 MoE、無共享專家、第一層用全域注意力配 dense FFN,其餘交錯滑動視窗與全域注意力,靠可學習的 attention sink bias 維持長上下文。真正的差異在編碼器與 RL。

放到同級對手裡看,DeepSeek-V4.1-Flash 有原生圖片理解但沒有音訊,GLM-5.3-Flash 是 320B 的多模態,Qwen3.8-Max 則是 2.4T 的多模態開源模型。MiMo-V2.6-Flash 用 15B 激活參數同時做到四種模態,成本優勢明顯。

RL 訓練:這一版的真正核心

小米在不到 6 天內讓 Pro 和 Flash 各完成 30 個 RL 步驟,累計約 75 萬條軌跡,成本分別約為 85 萬美元與 262 萬美元。訓練任務的平均通過率相對提高 25%(Flash)與 12%(Pro)。

算力從三個方向擴大。第一是更大批次與更高吞吐:全非同步架構,每次更新 1,568 個樣本,支援 1M 上下文長度訓練,單步處理 35 到 37 億 tokens。第二是更多任務與更複雜的環境:涵蓋程式開發、通用代理、視覺與資安的多領域任務體系,混合多種測試框架,讓不同能力的進步彼此強化。第三是投入更多評分器算力,在每組樣本內做相對比較,為長時程任務提供更精確的獎勵訊號,形成自我改進迴圈,並引導模型用更短路徑、更少 tokens 完成任務。

方法上有幾個設計值得記。官方稱之為「You Only RL Once」,意思是程式開發、通用代理、視覺、資安四個領域混在同一個 RL run 裡跑,而不是分領域各跑一次,好處是能力能互相遷移到訓練時沒見過的框架。

獎勵訊號本身也被擴大。通過/失敗是二元判斷,無法分辨哪個通過的解法品質更好,所以小米加入 Groupwise Reward Synthesis(離線用對比 rollout 建立任務評分表)與 Groupwise Advantage Redistribution(線上對通過的軌跡排名,把 advantage 傾向品質更高的解)。

穩定度方面,隨著訓練規模擴大,官方凍結 MoE 路由器以抑制專家負載漂移,並建立一條涵蓋獎勵設計、對抗式評估、異常偵測與驗證器交叉校驗的防線,專門對付 reward hacking。

成效與落差

在保留的長時程軟體工程基準 DeepSWE v1.1 上,Flash 從 48.8 進步到 65.7,Pro 從 58.4 進步到 72.6,顯示 RL 有良好的樣本效率,而且能泛化到訓練分布之外。

完整基準對照:

基準 V2.6-Pro V2.6-Flash 對照(Claude Opus 5/GPT-5.6 Sol)
DeepSWE v1.1 71.9 67.9 74.0/73.0
Terminal Bench 4.0 34.9 28.8 49.0/39.9
Toolathlon-Verified 76.9 73.6 80.6/74.9
AutomationBench v1.0.6 53.1 52.3 50.3/45.8
Agents’ Last Exam 31.6 27.6 31.6/30.8
CyberGym 94.0 95.1
ExploitGym 17.8 6.0 22.1/30.3
MiMo Visual Coding 72.3 71.5 70.0/73.4

幾點觀察。相對前代是跳躍式進步,V2.5-Pro 在 DeepSWE v1.1 只有 19.0,V2.6-Pro 一口氣到 71.9,官方甚至宣稱 Flash 全面超越 V2.5-Pro。資安軸是亮點,Flash 的 CyberGym 拿到 95.1,反超自家 Pro。

落後的項目也很清楚。終端機長程與漏洞利用類差距不是一點點:Terminal Bench 4.0 的 28.8 對上 GPT-6 Astra 的 59.6,ExploitGym 的 6.0 對上 42.4。官方把這些落後項目一併列出,這種不只報喜的呈現方式反而提升可信度。

要提醒的是,這些數字都是廠商自報,測試框架與 reasoning effort 設定各廠不同。DeepSeek 自己公布過一張 scaffold 對照表,同一個模型在 DeepSWE v1.1 上從 65.5 到 74.2,8.7 分的落差,全部來自外包的 agent 軟體,比多數模型之間的差距還大。跨表相減沒有意義,要比較就在自己的工作負載上做 A/B 測試。

開源了什麼

除了 Pro 和 Flash 的權重與技術報告(皆 MIT),小米同步開源:

Hacker News 社群怎麼看

發布當天的討論串拿到 483 分、249 則留言,主要觀點可以歸成四類。以下都是網友意見,不等同於查證過的事實。

訓練透明度是最大共識。有人說即時 RL 儀表板對他是很好的學習與教學工具,公開了訓練損失、每個 checkpoint 的基準分數、運行成本、重啟紀錄與失敗原因,技術報告也有 Google 或 DeepSeek 式的幕後細節。有留言特別肯定團隊沒有只展示成功案例,例如曾因資安資料集拖累程式開發基準而將其移除。

價格與開放權重帶來強烈吸引力。有網友指出,1T 的 V2.6-Pro 在 15 項基準中 14 項贏過 2.8T 的 Kimi K3,同時維持原價。不少人表示近期對中國模型的興趣高於美國模型,原因是價格更低、能力快速追近、開放權重帶來部署彈性。

真實工作負載的評價分歧。正面經驗認為便宜的中國模型在狹窄任務上可能勝過前沿模型;負面經驗則提到部分模型在生產環境會陷入無限迴圈、消耗大量 tokens、需要密切監督。也有人提醒部署堆疊會影響品質,vLLM 中介層如果無法正確回傳推理內容,特定模型的表現就會被打折扣。

對基準保持保留。一部分留言認為模型選擇仍應以自己的工作負載做 A/B 測試,支持者則認為小米連落後項目也公布,提升了可信度。另有一個提醒很實際:實際成本不能只看每 token 單價,若模型推理過久、陷入循環、需要更多人工監督,總成本可能反而更高。

討論也大量延伸到 AI 監管、產業政策與美中競爭,但那些屬於立場辯論,與模型本身的技術結果應該分開看。

取得方式與部署

Pro 和 Flash 現在可以透過 AI Studio、MiMo Code、MiMo Desktop、MiMo API Platform 與 OpenRouter 使用。MiMo Desktop 也同步結束搶先體驗,推出首個正式版本。

自架的話,官方推薦 SGLang,Flash 需要 --tp 8 --dp 2,Pro 則需要 --tp 16 --ep 16 跨兩台機器。vLLM 也支援,但官方在模型卡註明 stable 版本可能落後,建議照 MiMo-V2.5 的 recipe 走。建議把 temperature 設 1.0、top_p 設 0.95。

1.02T 的 Pro 用 FP8 跑需要多機張量平行,門檻不低;309B 的 Flash 相對可行,但官方目前沒有提供低精度量化方案。一般使用者走 API 或 OpenRouter 比較實際。

值得追蹤的三件事

第一,RL 環境與訓練框架開源後,社群能不能真的復現這些數字。第二,Flash 版的第三方實測,發布當天幾乎沒有直接體驗可查,等一週再下判斷比較穩。第三,會不會出現 GGUF 量化衍生,那會決定它能不能進本地部署的主流清單。

參考來源

Exit mobile version