Kolibri 發布後最辣的指控就是這一句:德國主權模型,結果是拿中美模型蒸出來的。這句半對半錯,對的是有借,錯的是借了多少、借在哪一段。
先把時間軸釘死:Aleph Alpha 不是被抓包,是 10 月 3 日發布當天自己在 model card、技術報告、EU AI Act 訓練資料摘要裡寫的。傳成醜聞,是二手轉述把比例誇大了。
自建的部分:權重、架構、管線
- 權重從隨機初始化訓起,不是拿 Qwen 或 GLM 接著微調。證據是架構對不上:50 層全 MoE、每層 384 個小 expert 加 1 個 shared expert、每 token 路由 6 個,model dim 2560,48 query 對 4 KV。這不是 Qwen dense 27B 的形狀,也不是 GLM 家的形狀。
- 算力帳單具體到無法編:768 張 B200,前訓練 20T 跑 21 天,加中期 3.44T 加長上下文 200B,合計近 24T。Muon 優化器加自研 exact quantile balancing,38 次硬體中斷自動重啟。
- Tokenizer 自研 UniBPE,128k 詞表,德語壓縮 4.90 bytes per token 同場最佳。
Bundessozialgerichtes切得比 GPT-5、Qwen、Gemini 乾淨,這段沒人幫他做。 - 前訓練 20T 的大頭是自洗原生語料:英文約六成二、德語約兩成二到兩成四、程式約一成四。從 200T 原始 token 過濾去重下來的,去重、啟發式過濾、quality classifier 這套 recipe 才是他宣稱的 know-how。
借的部分:改寫、標註、一部分合成
- 德語 2.4T 不重複池:1.3T 自建 Common Crawl 德語管線洗出來的原生網頁,約 1T 德文改寫,390B 開放資料集,剩下是國會議事錄、法律文本等公有領域加少量翻譯。翻譯只佔整體 6%。
- 德文改寫用 Mistral-NeMo,英文改寫用 Google Gemma 4,Qwen3-32B 只做 quality filter 打分。這段是 data-level 加工,知識還是自己的德文,不是英翻德。
- SFT 用 174B token 合成資料過濾剩 167B,混開源資料一起訓。RL 是 80 萬任務環境,涵蓋推理、agentic、指令遵循、程式、問答、tool calling。
- 混入合成池的老師名單:Gemma、Qwen、Mistral Nemo、GLM、Kimi K2.6。確切版本和比例沒全公開,這是目前資訊缺口。
所以技術上這就是蒸餾,overall pipeline 叫 synthetic distillation 或 data distillation 都成立。但不是整顆行為複製,不是對著別家 API 狂打幾千萬次那種 adversarial distillation。
授權那條我之前講錯了,更正
上一輪我說 Gemma、Qwen、GLM、Kimi 大多禁拿輸出訓競品,被問有確定嗎。回去對原文,答案是大多沒禁:
- Qwen3 系列、Mistral-NeMo 是 Apache 2.0,直接放行。
- GLM 的 5、5.2、Flash 系是 MIT,直接放行。只有 GLM-5.3 自訂授權多一條大廠託管審查,跟蒸餾無關。
- Kimi K2 base 是 Modified MIT,只有超大商用要掛名。禁競品的是 Kimi-K2-Thinking 自訂授權,但 Kolibri 寫的是 Kimi K2.6,版本對不上。
- 唯一沾邊的是 Gemma:拿 Gemma 輸出訓出來的模型算 Model Derivative,要繼承它的 Prohibited Use Policy。Google 對 Output 本身不主張權利。
真正的灰區只剩一題:Aleph 到底用本地權重跑合成,還是打別家 API 跑合成。API 的 ToS 另有競品限制,但他沒公開走哪條通道,這段目前無從判定。
主權到底是什麼
Aleph 的定義從第一天就寫明:團隊在德國、算力在德芬、受歐盟德國法管、無外國控制,pipeline 自持、可交代、可審計。原文那句 Sovereign doesn't mean nothing from outside Europe went in 就是預防針。
你要用血統純正標準打他,他確實摻了中美模型的口水,不純。要用管轄權加可審計加斷供還能跑的標準看,他的主張站得住。主權在這裡是供應鏈和法域的事,不是每個字都歐洲原生。
結論:借了,但沒全借。自建的是權重、架構、管線、德語料大頭。借的是改寫器、標註器、一部分合成料。罵要罵在點上:版本比例沒公開、API 通道沒交代、Gemma 衍生條款沒處理,這三個才是還沒回答的問題。
資料來源:Aleph Alpha 官方部落格與 189 頁技術報告(2026/10/03),Hugging Face Aleph-Alpha/Kolibri-1 model card,EU AI Act 訓練資料摘要 data-summary.pdf,各家授權原文(Gemma Terms、Qwen Apache 2.0、GLM MIT 與 GLM-5.3 自訂授權、Kimi Modified MIT 與 Thinking 自訂授權)。
