開源 78B 德英 MoE LLM:Aleph Alpha 的 Kolibri
2026 年 10 月 3 日(德國統一紀念日),德國 AI 公司 Aleph Alpha 正式開源釋出 Kolibri——一款針對德語與英語設計的開放權重大語言模型。Kolibri 是德語「蜂鳥」之意,恰如其「輕量」定位:模型總參數量為 781 億,每個 token 實際啟用的參數僅約 34.6 億;採 Apache 2.0 授權釋出權重,訓練從零開始於德國與芬蘭的資料中心基礎設施跑完,採用 768 張 NVIDIA B200 GPU,總訓練量約 24 兆 token,其中逾五分之一為德文。
什麼是「主權 AI」?Aleph Alpha 的雙重定義
Aleph Alpha 在 Kolibri 發布稿中明確將「sovereign(主權)」拆成兩個層次:
- 建構層:模型由德國團隊建構、在德國與芬蘭的基礎設施上訓練、遵循歐盟與德國法律、無任何外國控制。
- 交付層:客戶可獲得完整部署自由與智慧財產權保障,「合規性成為繼承屬性」。換言之,歐洲政府機關、車廠、航太業者能在自家機房跑模型,資料不出大門,且無人可從外部關閉或修改模型。Aleph Alpha 同時簽署了 EU《通用 AI(GPAI)行為準則》。但「主權」並不代表模型內部沒有任何外部元素:模型卡坦承英文網路文本曾用 Google 的 Gemma 4 改寫、德文用 Mistral-NeMo、品質過濾則借助 Qwen3-32B 標註資料;Aleph Alpha 還主動過濾掉訓練資料中已量測過的政治偏誤(其本身曾對中文開源模型做過這類偏誤研究)。
Kolibri 的六大設計巧思
Kolibri 的技術設計可拆為六個堆疊層,每一層都是為了讓「德語處理更便宜、更長、或更誠實」。
1. 384 位專家,每個 token 只見 6 位
Kolibri 是典型的 Mixture of Experts(MoE,混合專家) 模型:50 層、每層 384 位專家加 1 位共享專家,由路由器為每個 token 選 6 位專家。這讓 781 億參數在每個 token 推理時只動用約 35 億,等同「3.5B 等級的稠密模型」。但代價是——醫院無論是否用到,384 位專家都得在編制內,所以 Kolibri 計算成本等同 3.5B 模型,記憶體卻是 78B 規模。模型卡明寫:「即使只有部分參數運作,整個模型都必須載入記憶體。」
2. 為長德文單字量身打造的 tokenizer
LLM 讀的不是字,而是 tokenizer 切出來的 token;德語靠複合字構詞(如「Bundesverfassungsgericht」聯邦憲法法院),英語導向的 tokenizer 會把這種字切碎。Kolibri 的 tokenizer 詞表 12.8 萬,使用 Aleph Alpha 自創的 UniBPE 演算法——保留 BPE 的由下而上合併,但每一步合併採 Unigram 目標評分,特別照顧德語構詞規律。實測結果:對德國《基本法》(185 KB 法律德文),Kolibri 比 GPT-5 用的 o200k_base tokenizer 少 15% 的 token(比 Aleph Alpha 官方公布的 11.2% 還優);英文則幾乎打平。token 越少,同等語境能容納的德文就越多,對長文件處理是直接紅利。
3. 多數層只看鄰近,每 5 層才看全局
50 層中有 40 層用 sliding-window attention(滑動視窗注意力):每個 token 只看前 512 個 token;每 5 層才做一次 full attention,看完整個上下文。這是讓 1 百萬 token 語境可負擔的關鍵設計——多數層不必計昂貴的全域注意力開銷。
4. 用德語思考多數推理模型即使收到德文 prompt,內部仍以英文思考,常發生「德文問題、英文思考、英文回答」的尷尬。Aleph Alpha 在 9 月 24 日的 Through the Valley of Tears 文章揭露:模型一開始嘗試用少量德文推理資料微調,結果德文數學成績從 70.2 暴跌至 48.3(因為德文思考容易繞圈走不出來);最後靠大量德文推理資料才回升至 67.3。
Kolibri 直接採用海量德文推理訓練,結果在 AIME 2025 德文數學測試上拿到 87.5 分,擊敗同級距的 NVIDIA Nemotron 3 Nano(84.4 分)。
5. Merlin-Arthur 協議:被訓練成會說「我不知道」
Kolibri 是少數被明確訓練來「承認不知道」的開源 LLM。Aleph Alpha 自創的 Merlin-Arthur 訓練法是個三人遊戲:
- Arthur(模型):拿到問題與部分被遮住的文件
- Merlin:遮住讓答案「更容易找到」的部分,訓練 Arthur 答對
- Morgana:遮住答案依據的證據,訓練 Arthur 承認「我不知道」
Arthur 永遠不知道面對的是 Merlin 還是 Morgana,所以唯一贏的方式是真的檢查手邊證據是否支持答案。實測在 Artificial Analysis 的 Omniscience 測試上:Kolibri 不知道答案時選擇坦承(或部分回答)的比例達 44%,遠勝 Qwen3.5 35B-A3B 的 11.1% 與 GPT-OSS 120B 的 23.7%。但代價是——知識量較少:純封閉書問答答對率僅 14.8%,而 Qwen3.5 35B-A3B 為 22.2%。它適合做文件問答,不適合做百科問答。
6. 思考強度可調每個請求可設定 reasoning_effort 為 none / low / medium / high——同一個模型同一台伺服器,可快速查詢也可深度推理。
Kolibri 的強項依 Aleph Alpha 自家評測(用每家模型開發商建議的採樣設定跑同一套基準),Kolibri 在同類約 3B active 參數模型中領先的位置:
- 英文總分:75.5(vs Qwen3.5 35B-A3B 74.7)
- 德文總分:70.8(vs Qwen3.5 35B-A3B 69.8)
- AIME 2025 英文:96.9(領先所有 MoE 比較對象,包括 12B active 的對手)
- AIME 2025 德文:87.5(vs Nemotron 3 Nano 84.4)
- 公司文件問答(半導體、德國公部門、航太、車廠、工業傳動 5 個客戶型任務):89.7
- 1M token 長語境(RULER):63.2(vs Nemotron 3 Nano 58.5)數學是最大亮點——AIME 2025 與 2026 上擊敗所有 MoE 比較對象(包含 12B active 的)。
Kolibri 的弱點
Aleph Alpha 把最弱的數據跟最強的並列陳列,這點值得肯定:
- 記憶型知識較少:封閉書 RAG 基準 51.0 分排 12 個模型最末;Omniscience 答對率 14.8%。
- 多輪工具呼叫較弱:BFCL 多輪測試 39.8 分(GLM-4.7 Flash 58.2、Qwen3.5 35B-A3B 54.0)。
- 不是最佳編碼代理:Terminal-Bench 2.1 拿 27.7 分(Qwen3.5 35B-A3B 39.7);SWE-bench Verified 66.4 分(Qwen3.6 35B-A3B 73.8)。
- 中段長語境反下滑:在 128K token 處,Qwen3.5 base 模型 89.9 分,Kolibri 67.9 分;Kolibri 僅在超長前段才追上。
- 記憶體門檻高:78 GB 權重,至少需要 2 張 80 GB 的 A100 / H100 或 1 張 H200 / B200 / B300——不是筆電跑得動的東西。
- 生態尚新:需要 Aleph Alpha 自己的 vLLM plugin,目前只支援 vLLM 0.29;發布當下還沒有任一商用 API 託管商提供 Kolibri。
- 只支援 2 種語言:這是刻意選擇——模型卡稱為「深度優先於廣度」的權衡。
怎麼跑 Kolibri
最低需求約 78 GB GPU 記憶體(2 張 80 GB 的 A100 / H100,或 1 張 H200 / B200 / B300):
pip install 'aleph-alpha-inference>=1'
vllm serve Aleph-Alpha/Kolibri-1 \
--kv-cache-dtype fp8 \
--reasoning-parser kolibri1 \
--tool-call-parser kolibri1 \
--enable-auto-tool-choice
伺服器啟動後即為 OpenAI 相容 API,可用任何 OpenAI client 串接;reasoning_effort 透過 chat template kwargs 傳入。模型卡建議 temperature=1.0、top_p=0.97、top_k=128;延遲敏感場景建議 context 不超過 262,144 token,要拉滿 1M token 須加 --max-model-len 1048576。
為什麼這件事重要:歐洲「主權 AI」的具體兌現
Kolibri 不只是又一個開源 LLM——它是 Aleph Alpha 與加拿大 Cohere 合併(2026 年 9 月 16 日簽署、傳聞 200 億美元規模)之後,第一個真正以「歐洲主權 AI」名義交付的旗艦開源模型。歐洲企業、公部門、軍工等受監管產業要落地 LLM,過去幾乎只能在「用美國雲端 API(資料出境)」與「自行從頭訓練一個小模型(成本與品質都有限)」二選一。Kolibri 直接把第三條路擺上桌:
- 78B / 3.5B 的 MoE 設計:保留稠密大模型的知識容量,把推理成本壓到 3.5B 等級
- 德文原生 tokenizer + 德文推理:不是把 GPT 翻成德文,而是把德語作為「一級語言」設計
- 會說「我不知道」:配合 RAG 架構,特別適合政府、銀行、車廠、醫療這種「寧可模型拒答也不要亂編」的法遵場景
- Apache 2.0 權重 + 完整技術報告:客戶可審計、可改、可在自己機房跑這代表歐洲 GAIA-X 資料空間、EU AI Act 法遵、AI 主權倡議等政策口號,第一次有了「開箱即用」的開源底層。
數據解讀 / 質疑:對手沒列在表上
Aleph Alpha 的基準表漂亮,但有兩個值得放大檢視的關鍵點:
1. 比較對象是「春季隊伍」
Kolibri 對標的 Qwen3.6-35B-A3B、Nemotron 3 Super 120B-A12B、Mistral Small 4 119B-A6B——全部是 2026 年春季發布的開源模型。但 2026 年秋季的中國開源陣營已大幅進化:
| 模型 | 開發者 | 總參 / active | Intelligence Index |
|---|---|---|---|
| MiMo-V2.6-Pro | 小米 | 1T / 42B | 46 |
| GLM-5.3 | Z.ai | 753B / 40B | 45 |
| Kimi K3 | Moonshot AI | 2.8T / 104B | 44 |
| GLM-5.3 Flash | Z.ai | 320B / 18B | 42 |
| Qwen3.8-Flash-Next | 阿里巴巴 | 180B / 6B | 40 |
| Qwen3.8 27B | 阿里巴巴 | 27B(稠密) | 34 |
| K2 Horizon MoVA | IFM | 36B / 4B | 25 |
| Kolibri(推估) | Aleph Alpha | 78B / 3.5B | 15–20 |
依 Aleph Alpha 公布的基準外推,Kolibri 在 Artificial Analysis Intelligence Index 上大約落在 15–20 分——落後至少 20 個開源模型,且同一個約 3B active 級距已有 K2 Horizon MoVA(25)與 Qwen3.8-Flash-Next(40)擋在前面。
2. 「主權」與「加拿大老闆」能否共存
Aleph Alpha 在 9 月已與 Cohere 簽署合併協議,新公司將以 Cohere 為名運作,總部落在多倫多與柏林。對 HN 社群而言,這帶來一個尖銳問題:當 Aleph Alpha 100% 由多倫多總部運作、且 Cohere 大股東為美國/加拿大資本時,「主權」訴求是否還站得住?一位評論者寫道:「Cohere 接管完成後,即使他們 90% 由加拿大持有、100% 在多倫多運作,還能用這個主權主張嗎?」這個質疑合理——「主權 AI」的可信度,最終取決於治理結構而非訓練地。Aleph Alpha 的技術選擇無可挑剔,但商業主權性要靠合併協議中的治理條款(兩國雙總部、特定股東否決權)撐起來。
何時該選 Kolibri
適合的場景:
-
德文長文件問答(法律、合同、手冊):tokenizer、1M 語境、Merlin-Arthur 三者一起發揮
-
受監管產業(公部門、銀行、車廠、航太、醫療):需要資料不出門、需要模型承認不知道
-
自有機房:有 78 GB GPU 記憶體預算不適合的場景:
-
編碼代理:Qwen3.6 35B-A3B 在這塊領先
-
百科型問答:Kolibri 純記憶型知識明顯較弱
-
非德文 / 英文以外的語言:模型卡明說只支援 2 種
-
沒有資料中心級 GPU 的場景:78 GB 是硬底線
結論
Kolibri 把「歐洲能不能做自己的開源 LLM」這個問題,從政治宣言推進到技術交付。它的德文 tokenizer、德文推理、Merlin-Arthur 拒答訓練、Apache 2.0 權重釋出——每一項都是具體可驗證的工程決定,不是話術。但也要誠實說:純以 Intelligence Index 看,它已被 2026 年秋季的中國開源陣營甩開。Kolibri 真正的價值在於它是目前唯一一個完全在歐洲法律框架下完成、且開源權重可審計的旗艦級 LLM——對受監管產業而言,這個價值遠超基準跑分。
編按:本文綜合整理自 Tejas Kumar 技術分析、Aleph Alpha 官方技術報告、Aleph Alpha 發布稿、Trending Topics 評比 與 ExplainX 評論文,並加入 Siami 編輯部觀點與分析。
網友熱門留言 (5)