小米在 2026 年 9 月 22 日發布並開源 MiMo-V2.6 系列,包含 Pro、Flash 與 Pro-UltraSpeed 三款模型。這是小米在 RSI(遞迴式自我改進)路徑上的關鍵一步:把算力砸在可驗證的複雜任務上,讓模型透過強化學習的探索與回饋持續擴張能力邊界。
跑分當然要談,但這一版真正有意思的是另外兩點。一是小米第一次做出原生全模態的模型,二是他們把整段 RL 訓練過程連同成本、失敗紀錄一起直播給全世界看。
規格一次看
| 項目 | MiMo-V2.6-Pro | MiMo-V2.6-Flash |
|---|---|---|
| 參數 | 1.02T 總/42B 激活 | 309B 總/15B 激活 |
| 層數(總/滑動視窗/全域) | 70/60/10 | 48/39/9 |
| 上下文 | 1M tokens | 1M tokens |
| 模態 | 文字、圖片、影片、音訊 | 同左 |
| 授權 | MIT | MIT |
| API 輸入(未命中快取) | $0.435 | $0.14 |
| API 輸出 | $0.87 | $0.28 |
第三款 Pro-UltraSpeed 是 Pro 的高速推論模式,宣稱輸出速度最高提升 20 倍,定價 $4.35 輸入、$8.7 輸出(每百萬 tokens)。API 模型名必須全小寫。
價格維持 V2.5 不變,等於同等價格拿到升級後的智慧。官方宣稱 Pro 在同等智慧水平下,價格只有海外模型的二十分之一到六十分之一。
全模態是這一版最大的斷代
前一代的 MiMo-V2.5-Pro 與更早的 MiMo-V2-Flash 都是純文字模型。V2.6 的 Pro 和 Flash 則是原生全模態,兩款共用同一組編碼器:
- 視覺編碼器是 681M 參數的 MiMo ViT,28 層(24 層滑動視窗、4 層全域),patch 大小 2×16×16。
- 音訊編碼器由 308M 的 AudioTokenizer(24 層、20 個 RVQ codebook)搭配 127M 的音訊 patch 編碼器組成,把 25 Hz 降到 6.25 Hz。
- 投機解碼用 5 層滑動視窗的 MTP 草稿模型,每次 forward 預測後續 7 個 token,比前代的 3 層更厚。
Backbone 本身變化不大,仍是稀疏 MoE、無共享專家、第一層用全域注意力配 dense FFN,其餘交錯滑動視窗與全域注意力,靠可學習的 attention sink bias 維持長上下文。真正的差異在編碼器與 RL。
放到同級對手裡看,DeepSeek-V4.1-Flash 有原生圖片理解但沒有音訊,GLM-5.3-Flash 是 320B 的多模態,Qwen3.8-Max 則是 2.4T 的多模態開源模型。MiMo-V2.6-Flash 用 15B 激活參數同時做到四種模態,成本優勢明顯。
RL 訓練:這一版的真正核心
小米在不到 6 天內讓 Pro 和 Flash 各完成 30 個 RL 步驟,累計約 75 萬條軌跡,成本分別約為 85 萬美元與 262 萬美元。訓練任務的平均通過率相對提高 25%(Flash)與 12%(Pro)。
算力從三個方向擴大。第一是更大批次與更高吞吐:全非同步架構,每次更新 1,568 個樣本,支援 1M 上下文長度訓練,單步處理 35 到 37 億 tokens。第二是更多任務與更複雜的環境:涵蓋程式開發、通用代理、視覺與資安的多領域任務體系,混合多種測試框架,讓不同能力的進步彼此強化。第三是投入更多評分器算力,在每組樣本內做相對比較,為長時程任務提供更精確的獎勵訊號,形成自我改進迴圈,並引導模型用更短路徑、更少 tokens 完成任務。
方法上有幾個設計值得記。官方稱之為「You Only RL Once」,意思是程式開發、通用代理、視覺、資安四個領域混在同一個 RL run 裡跑,而不是分領域各跑一次,好處是能力能互相遷移到訓練時沒見過的框架。
獎勵訊號本身也被擴大。通過/失敗是二元判斷,無法分辨哪個通過的解法品質更好,所以小米加入 Groupwise Reward Synthesis(離線用對比 rollout 建立任務評分表)與 Groupwise Advantage Redistribution(線上對通過的軌跡排名,把 advantage 傾向品質更高的解)。
穩定度方面,隨著訓練規模擴大,官方凍結 MoE 路由器以抑制專家負載漂移,並建立一條涵蓋獎勵設計、對抗式評估、異常偵測與驗證器交叉校驗的防線,專門對付 reward hacking。
成效與落差
在保留的長時程軟體工程基準 DeepSWE v1.1 上,Flash 從 48.8 進步到 65.7,Pro 從 58.4 進步到 72.6,顯示 RL 有良好的樣本效率,而且能泛化到訓練分布之外。
完整基準對照:
| 基準 | V2.6-Pro | V2.6-Flash | 對照(Claude Opus 5/GPT-5.6 Sol) |
|---|---|---|---|
| DeepSWE v1.1 | 71.9 | 67.9 | 74.0/73.0 |
| Terminal Bench 4.0 | 34.9 | 28.8 | 49.0/39.9 |
| Toolathlon-Verified | 76.9 | 73.6 | 80.6/74.9 |
| AutomationBench v1.0.6 | 53.1 | 52.3 | 50.3/45.8 |
| Agents’ Last Exam | 31.6 | 27.6 | 31.6/30.8 |
| CyberGym | 94.0 | 95.1 | — |
| ExploitGym | 17.8 | 6.0 | 22.1/30.3 |
| MiMo Visual Coding | 72.3 | 71.5 | 70.0/73.4 |
幾點觀察。相對前代是跳躍式進步,V2.5-Pro 在 DeepSWE v1.1 只有 19.0,V2.6-Pro 一口氣到 71.9,官方甚至宣稱 Flash 全面超越 V2.5-Pro。資安軸是亮點,Flash 的 CyberGym 拿到 95.1,反超自家 Pro。
落後的項目也很清楚。終端機長程與漏洞利用類差距不是一點點:Terminal Bench 4.0 的 28.8 對上 GPT-6 Astra 的 59.6,ExploitGym 的 6.0 對上 42.4。官方把這些落後項目一併列出,這種不只報喜的呈現方式反而提升可信度。
要提醒的是,這些數字都是廠商自報,測試框架與 reasoning effort 設定各廠不同。DeepSeek 自己公布過一張 scaffold 對照表,同一個模型在 DeepSWE v1.1 上從 65.5 到 74.2,8.7 分的落差,全部來自外包的 agent 軟體,比多數模型之間的差距還大。跨表相減沒有意義,要比較就在自己的工作負載上做 A/B 測試。
開源了什麼
除了 Pro 和 Flash 的權重與技術報告(皆 MIT),小米同步開源:
- MiMo-V2.6-Distill-Qwen-9B:Qwen3.5-9B 的監督微調蒸餾版,混合 77.4B tokens 語料,作為開放的 agentic RL 研究起點。從它起步做 RL 後 11 項評測全數進步,SWE-bench Verified 從 61.1 到 66.2,Terminal Bench 2.1 從 37.1 到 52.8。
- 7 千多個高品質 RL 任務環境,涵蓋軟體工程、漏洞重現、知識型工作、網頁設計四類。
- 端到端 RL 訓練框架,基於 verl、uni-agent 與 mini-swe-agent,覆蓋環境互動、軌跡採集、獎勵評估與策略最佳化。
- 輕量可組合的測試框架,把系統提示、工具與上下文管理解耦,支援多框架訓練以提高泛化能力。
Hacker News 社群怎麼看
發布當天的討論串拿到 483 分、249 則留言,主要觀點可以歸成四類。以下都是網友意見,不等同於查證過的事實。
訓練透明度是最大共識。有人說即時 RL 儀表板對他是很好的學習與教學工具,公開了訓練損失、每個 checkpoint 的基準分數、運行成本、重啟紀錄與失敗原因,技術報告也有 Google 或 DeepSeek 式的幕後細節。有留言特別肯定團隊沒有只展示成功案例,例如曾因資安資料集拖累程式開發基準而將其移除。
價格與開放權重帶來強烈吸引力。有網友指出,1T 的 V2.6-Pro 在 15 項基準中 14 項贏過 2.8T 的 Kimi K3,同時維持原價。不少人表示近期對中國模型的興趣高於美國模型,原因是價格更低、能力快速追近、開放權重帶來部署彈性。
真實工作負載的評價分歧。正面經驗認為便宜的中國模型在狹窄任務上可能勝過前沿模型;負面經驗則提到部分模型在生產環境會陷入無限迴圈、消耗大量 tokens、需要密切監督。也有人提醒部署堆疊會影響品質,vLLM 中介層如果無法正確回傳推理內容,特定模型的表現就會被打折扣。
對基準保持保留。一部分留言認為模型選擇仍應以自己的工作負載做 A/B 測試,支持者則認為小米連落後項目也公布,提升了可信度。另有一個提醒很實際:實際成本不能只看每 token 單價,若模型推理過久、陷入循環、需要更多人工監督,總成本可能反而更高。
討論也大量延伸到 AI 監管、產業政策與美中競爭,但那些屬於立場辯論,與模型本身的技術結果應該分開看。
取得方式與部署
Pro 和 Flash 現在可以透過 AI Studio、MiMo Code、MiMo Desktop、MiMo API Platform 與 OpenRouter 使用。MiMo Desktop 也同步結束搶先體驗,推出首個正式版本。
自架的話,官方推薦 SGLang,Flash 需要 --tp 8 --dp 2,Pro 則需要 --tp 16 --ep 16 跨兩台機器。vLLM 也支援,但官方在模型卡註明 stable 版本可能落後,建議照 MiMo-V2.5 的 recipe 走。建議把 temperature 設 1.0、top_p 設 0.95。
1.02T 的 Pro 用 FP8 跑需要多機張量平行,門檻不低;309B 的 Flash 相對可行,但官方目前沒有提供低精度量化方案。一般使用者走 API 或 OpenRouter 比較實際。
值得追蹤的三件事
第一,RL 環境與訓練框架開源後,社群能不能真的復現這些數字。第二,Flash 版的第三方實測,發布當天幾乎沒有直接體驗可查,等一週再下判斷比較穩。第三,會不會出現 GGUF 量化衍生,那會決定它能不能進本地部署的主流清單。
