Aleph Alpha 在德國統一日丟出 Kolibri:78B 總參數、只啟動 3.46B 的 MoE,英德雙語,原生支援 1M 上下文,Apache 2.0 直接上 Hugging Face。故事很動人,數字卻很殘酷。
先講殘酷的數字
官方技術報告自家 harness,總分:
- 英文:Qwen3.8 27B 是 80.2,Kolibri 是 75.5
- 德文:Qwen3.8 27B 是 79.9,Kolibri 是 70.8
德語為主打的模型,德語輸 9 分,這標題不是我下得狠,是表格自己寫的。數學德文 AIME 2026(DE)Kolibri 90.0 還能看,GPQA Diamond(DE)81.3 對 88.1 被拉開,MMLU-ProX(DE)75.5 對 82.4 也是輸。
HN 上最高讚質疑就這句:那欄 Qwen3.8 27B 幾乎整排贏,幹嘛選 Kolibri?
但拿 27B dense 打 3B active,本來就不公平
這是整件事最容易誤讀的地方:
- Qwen3.8 27B 是 dense,每個 token 27B 全開,算力貴、記憶體便宜
- Kolibri 是 78B MoE,每個 token 只開 3.46B,算力便宜、記憶體貴(FP8 權重約 78GB,全得放進 VRAM)
官方 Tom 親自下場回了兩次:兩者都在品質對服務成本的 Pareto frontier 上,只是位置不同。MoE 組內比,Kolibri 贏過 12B active 的 Nemotron 3 Super,對同級 3B active 全勝。
RTX Pro 6000 實測 fp8 約 170 tkn/s,速度確實是它的賣點。問題是 27B dense 32GB VRAM 就能半舒適跑,Kolibri 要 serve 全量 expert,窮人自架沒有比較省。這也是 HN 上 My vram says otherwise 酸的那點。
沒拿 Qwen3.8 Flash(6B active MoE)來比,更被抓包。Flash 又快又強,避開最新對手,只拿一年前的 Qwen3-Next 80B-A3B,這份報告的選角是有挑過的。
德語是真的有下功夫,不是機翻貼牌
罵歸罵,資料工程這段值得給掌聲:
- 20T 前訓練,德語佔 21.3%,約 4.3T
- 不重複德語池 2.4T,八成自建:Common Crawl 自建德語管線 1.3T,德語改寫 1T,開放資料只佔兩成
- 翻譯只佔 6%,團隊自己寫過
Sauerkraut, Not Burgers講機翻會帶美國文化指紋:chancellor 變 president 那種錯
Tokenizer 是自研 UniBPE,128k 詞表,德語壓縮 4.90 bytes/token,同場最佳。Bundessozialgerichtes 切成 Bundes sozial gericht es,對手全切碎。這不是英文模型順手讀德文,是雙語設計。
HN 上德國人自己講得最白:coding 根本不是這模型的主戰場,目標是支援部門的德文案件、三年前的專案郵件、不用過 cloud API 的本地 RAG。會說我不知道,比會編答案重要。
拒答人設,實測有一半破功
Merlin-Arthur 協議是這次主打:上下文沒證據就拒答。數字上 AA-Omniscience 非幻覺率 44% 對 Origin 15%,M/A grounding score 0.23 對手多半是 0。
但網友手動暗黑測試:
- 虛構歌曲
Glass Flowers by Armand Uso,Kolibri 一本正經編出 1978 年專輯樂評,Qwen3.8-27B 正確拒答 - 問 llama.cpp 低 RAM 跑法,Kolibri 回我不知道,叫你去點 HF 頁面
定位要搞清楚:它防的是有文件時的硬拗,不是考記憶時的唬爛。拿來當信任轉接器可以,拿來當先知會出事。
主權這頂帽子,HN 吵最兇
Aleph Alpha 即將併入加拿大的 Cohere,還談主權?這題被追著打。官方回得很坦白:合併公開沒藏,非美中實驗室只能抱團衝規模,主權指的是資料控制和部署自由,不是護照。
反方兩刀也很利:
- 主權當賣點,跑分爛也能宣稱成功,沒人逼自己變強
- Schwarz、SAP、NVIDIA 當金主,哪來實質主權
正方回得也不差:主權是能獨立持續改進,不是當下最強。open weights 是死的,pipeline 是活的,Kimi K4 不放權重你就斷炊。歐盟企業現在是真的怕美國斷供,location of data processor 是第一個檢查項。
我的判斷:公部門買單不是罵人的話,是商業模式。受監管產業要的是 EU AI Act、GDPR、著作權可交代,地端可跑,德語公文不會翻車。通用榜輸 Qwen,不妨礙它在 Honeypot agentic-RAG 拿 80.8 贏過 Nemotron 和 Mistral Small 4。
結論
Kolibri 不是最強的開源模型,是最誠實的歐洲模型之一。技術報告全攤開,德語資料和 tokenizer 是真貨,MoE 效率定位清楚。但德語輸 Qwen3.8 27B 也是真的,Flash 對比缺席也是真的。
要不要用,看你是哪種人:要最聰明的,去跑 Qwen;要在德國公部門機房裡跑、不想把公文丟去第三方推論、要合規可交代,Kolibri 是目前少數能選的。
主權從來不是跑分,是斷供那天你還有沒有得跑。
資料來源:Aleph Alpha 官方部落格與技術報告(2026/10/03),HN 討論串 item 49942706(655 分、326 則)。分數皆為官方 harness,跨 harness 不可直接比。
