Mistral 在十月六日發表 Large 4,代號 le Chonk。預覽介面已經上線,權重預定十月底釋出。
這是歐洲歷來少見的大規模公開訓練:1 兆參數,490 億啟用,原生多模態,在歐洲自有資料中心以 3,800 張 Grace Blackwell 從零訓練。官方說法很直接:美歐最強開放權重,資安、金融、法律等企業負載做到開放模型最佳。
重點速覽
- 規模:1 兆參數,490 億啟用,原生多模態
- 訓練:3,800 張 Grace Blackwell,歐洲自有資料中心
- 語言:160 種以上,涵蓋全部歐盟官方語言
- 發布:預覽介面已上線,權重十月底釋出,架構與後訓練細節後補
- 資金:30 億歐元 Series D 之後首個里程碑
官方公告整理
寫碼與代理流程
寫碼綜合指標 49.8%,勝過 DeepSeek V4 Pro 0813 與 Qwen3.8 Max。細項為 DeepSWE v1.1 61.7%,SWE-Atlas-QnA 59.4%,Terminal-Bench 4 28.3%。Surge AI 盲測拿下 3.74 分,在五個模型中排第二,只輸 Claude Opus 5 的 4.22 分。
企業自動化評測 AutomationBench 拿下 59.9%,勝過 Kimi K3、MiMo-V2.6-Pro、DeepSeek V4 Pro。長時程知識工作評測 AA-Briefcase 拿到 1,393 分,同樣勝過 DeepSeek V4 Pro。
資安:這次真正的主角
人工智慧資安指數 Cyber Index 排名全球前五。在重現真實漏洞並修補的題目上拿下 82%,全場最高。Cybench 四十題解出九成三,開放模型中少見。
關鍵對比在於拒答。Claude Opus 5.5 與 GPT-6 Astra 在同一題幾乎拿零分,因為直接拒答。防守方要證明漏洞存在,才能修補,封閉模型的拒答反而卡住正當工作。Mistral 的論點是:防守者需要同等級能力,也需要自行部署的自主權,事件應變不能斷在供應商的審查手上。
多模態與科學
視覺定位 Dense 200 拿下 42%,超過 GPT-6 Astra 的 41%。工程圖、文件檢索、十億畫素衛星圖都在展示範圍內。
科學寫碼 SciCode-Verified 做到開放模型最佳,官方稱可一次生成哈特里福克模擬。內部數理評測勝過 GLM-5.3。
知識工作
金融代理、試算表實務 FinWorkBench、Harvey 法律代理三項,經 vals.ai 第三方評測都勝過 GPT-6 Astra,開放模型中居首。
安全與強健
Lakera B3 攻擊抵抗率 93.3%,開放模型最高。KORA 拿下 1.691 分,滿分 2 分。資安惡意請求拒答率高於全部開放模型。
主權論述
全程在歐洲營運,不依賴其他數位服務商,受歐洲法律管轄,可私有雲或地端自行部署。權重釋出前先與資安領導廠商、審查夥伴、國家機關實戰紅隊,對方拿到低審查與增強資安版本。
網友反應整理
Hacker News 討論拿到 285 分,116 則留言。立場分明,沒有一面倒。
主權必要派認為,歐洲需要非美、非中選項。法軍比喻被推到高處:存在目的不是拿最佳,而是守住主權。有人說,寧可信法國權重沒有留後門,也不想把敏感工作交給中國或美國大廠。
資安利基肯定派認為,視覺與資安數字確實好,是好的防守型模型。終端機評測 28.3% 代表接入框架後不犯蠢,可當日常主力。
落後派指出,Vals Index 48.05% 對上 GLM-5.3 的 53.51%,單次測試貴一倍,13.78 美元對 7.25 美元。體積兩倍,卻略輸 DeepSeek 4.1 Flash。共識是落後前沿兩到三代,約一年。
存在意義質疑派問得最兇:哪個面向推過最佳?不如學 Cursor,拿現成預訓練做後訓練就好,何必重訓過時架構。回覆則說,導入企業不等於推邊界,但同樣有價值。
夠用對前沿之爭老調重彈。一方說多數工作不需前沿,最便宜夠用模型會勝出。一方說夠用是迷思,智慧沒有上限,Opus 5.5 等級的躍升仍在拉開差距,開放模型營收追不上。
補貼吵架串照例開戰。有人指 DeepSeek 背後是中國政府經濟戰補貼,隨即被圍攻:出身避險基金、補助極小。美方也在補貼並搞監管俘虜與貿易戰,哪邊都不乾淨。
雜項值得一記。暱稱梗 le Chonk 與 le Chaton Fat 洗版。有人問是否就是 OpenRouter 上的 space-bunny-alpha,一說是 MiniMax M3.1。有人抱怨圖表排序誤導。也有人說只要小模型,1,050 億級無用,120 億級可本地跑的 Qwen3.8-Flash-Next 才是剛需。
我的看法
我會把這次發布看成路線正確、能力待補。Mistral 沒有硬拚通用第一,而是押住資安與主權兩個歐洲非贏不可的位置。企業與公部門要的不是聊天對象夠不夠聰明,而是半夜斷網時能不能重現漏洞、修補上線。這題封閉模型交不了卷。
能不能坐穩一席之地,看權重釋出後的社群實測。視覺定位與資安實戰若經得起獨立重現,歐洲就有理由持續投錢投算力。通用落後一年可以追,主權空窗錯過就補不回來。
互動圖文頁
下圖把規格、評測、網友正反意見做成一頁,手機可直接點開備援連結閱讀。
手機版備援直連:Mistral Large 4 解讀圖文頁
