四十八個德瑞克

德國終於推出德語為主的主權模型,結果連Qwen3.8 27B的德語都打不過,靠公部門買單?

蜂鳥攜德國三色包裹面對巨熊伺服器走廊的社論插圖

Aleph Alpha 在德國統一日丟出 Kolibri:78B 總參數、只啟動 3.46B 的 MoE,英德雙語,原生支援 1M 上下文,Apache 2.0 直接上 Hugging Face。故事很動人,數字卻很殘酷。

先講殘酷的數字

官方技術報告自家 harness,總分:

德語為主打的模型,德語輸 9 分,這標題不是我下得狠,是表格自己寫的。數學德文 AIME 2026(DE)Kolibri 90.0 還能看,GPQA Diamond(DE)81.3 對 88.1 被拉開,MMLU-ProX(DE)75.5 對 82.4 也是輸。

HN 上最高讚質疑就這句:那欄 Qwen3.8 27B 幾乎整排贏,幹嘛選 Kolibri?

但拿 27B dense 打 3B active,本來就不公平

這是整件事最容易誤讀的地方:

官方 Tom 親自下場回了兩次:兩者都在品質對服務成本的 Pareto frontier 上,只是位置不同。MoE 組內比,Kolibri 贏過 12B active 的 Nemotron 3 Super,對同級 3B active 全勝。

RTX Pro 6000 實測 fp8 約 170 tkn/s,速度確實是它的賣點。問題是 27B dense 32GB VRAM 就能半舒適跑,Kolibri 要 serve 全量 expert,窮人自架沒有比較省。這也是 HN 上 My vram says otherwise 酸的那點。

沒拿 Qwen3.8 Flash(6B active MoE)來比,更被抓包。Flash 又快又強,避開最新對手,只拿一年前的 Qwen3-Next 80B-A3B,這份報告的選角是有挑過的。

德語是真的有下功夫,不是機翻貼牌

罵歸罵,資料工程這段值得給掌聲:

Tokenizer 是自研 UniBPE,128k 詞表,德語壓縮 4.90 bytes/token,同場最佳。Bundessozialgerichtes 切成 Bundes sozial gericht es,對手全切碎。這不是英文模型順手讀德文,是雙語設計。

HN 上德國人自己講得最白:coding 根本不是這模型的主戰場,目標是支援部門的德文案件、三年前的專案郵件、不用過 cloud API 的本地 RAG。會說我不知道,比會編答案重要。

拒答人設,實測有一半破功

Merlin-Arthur 協議是這次主打:上下文沒證據就拒答。數字上 AA-Omniscience 非幻覺率 44% 對 Origin 15%,M/A grounding score 0.23 對手多半是 0。

但網友手動暗黑測試:

定位要搞清楚:它防的是有文件時的硬拗,不是考記憶時的唬爛。拿來當信任轉接器可以,拿來當先知會出事。

主權這頂帽子,HN 吵最兇

Aleph Alpha 即將併入加拿大的 Cohere,還談主權?這題被追著打。官方回得很坦白:合併公開沒藏,非美中實驗室只能抱團衝規模,主權指的是資料控制和部署自由,不是護照。

反方兩刀也很利:

正方回得也不差:主權是能獨立持續改進,不是當下最強。open weights 是死的,pipeline 是活的,Kimi K4 不放權重你就斷炊。歐盟企業現在是真的怕美國斷供,location of data processor 是第一個檢查項。

我的判斷:公部門買單不是罵人的話,是商業模式。受監管產業要的是 EU AI Act、GDPR、著作權可交代,地端可跑,德語公文不會翻車。通用榜輸 Qwen,不妨礙它在 Honeypot agentic-RAG 拿 80.8 贏過 Nemotron 和 Mistral Small 4。

結論

Kolibri 不是最強的開源模型,是最誠實的歐洲模型之一。技術報告全攤開,德語資料和 tokenizer 是真貨,MoE 效率定位清楚。但德語輸 Qwen3.8 27B 也是真的,Flash 對比缺席也是真的。

要不要用,看你是哪種人:要最聰明的,去跑 Qwen;要在德國公部門機房裡跑、不想把公文丟去第三方推論、要合規可交代,Kolibri 是目前少數能選的。

主權從來不是跑分,是斷供那天你還有沒有得跑。


資料來源:Aleph Alpha 官方部落格與技術報告(2026/10/03),HN 討論串 item 49942706(655 分、326 則)。分數皆為官方 harness,跨 harness 不可直接比。

Exit mobile version