← 返回 Siami 首頁

德國 Aleph Alpha 開源 Kolibri:78B 參數「主權 LLM」主打德英雙語、可離線部署

▲ 382 💬 252
德國 Aleph Alpha 開源 Kolibri:78B 參數「主權 LLM」主打德英雙語、可離線部署

編按:本文綜合整理自 Aleph Alpha 官方部落格、Hacker News 討論串(382 分、252 則留言)、Kolibri 技術報告 PDF、Hugging Face 模型卡、tej.as 深度分析,並加入 Siami 編輯部觀點與分析。


事件:德國統一日開源、Apache 2.0、3B active 跑 78B 模型

2026 年 10 月 3 日(也是德國統一紀念日),總部位於德國海德堡的 AI 公司 Aleph Alpha 正式開源釋出 Kolibri——一款主打「主權 AI(Sovereign AI)」定位、英德雙語的 Mixture-of-Experts(MoE)大型語言模型,採用 Apache 2.0 授權釋出完整權重。

Kolibri 的核心規格:

  • 總參數量 78.1B,每次推論只啟動 3.46B 參數
  • 上下文長度最高 100 萬 token(可處理整本書或大型程式碼庫)
  • 預訓練 token 數 20 兆(20T),原始資料處理量超過 200 兆 token
  • 德文佔預訓練 token 的 21.3%,刻意「不用翻譯資料灌德文」(僅 6% 翻譯)
  • 在 Hugging Face 開放完整模型權重(Aleph-Alpha/Kolibri-1)

Kolibri 是我們 Model Factory 出廠的第二個模型,距離第一個 Kolibri Origin(30B)只相隔三個月。我們的目標是讓歐洲公共部門、航太、工業企業能在自己的機房裡跑 LLM,不必把內部資料送到第三方推論服務。

—— Aleph Alpha 官方部落格


什麼是「主權 AI」?為什麼 Aleph Alpha 要把模型定位在這裡?

Aleph Alpha 把「主權」拆成兩個維度:

1. 建造主權:從頭到尾都在歐洲法律管轄下完成

  • 訓練資料整理、預訓練、後訓練、優化全在德國與芬蘭的基礎設施上跑
  • 整個 pipeline 遵守 歐盟 AI Act、GDPR、通用 AI 行為準則(GPAI Code of Practice)
  • 沒有任何外國實體的決策權介入

2. 部署主權:客戶端可離線、可控管、可審計

  • 3B active / 78B total 的設計是關鍵——足夠小,企業可以單機或自有機房部署
  • 不用把公司機密、政府文件、病人病歷傳到 OpenAI / Anthropic / Google 的雲端
  • 模型內建「我不懂就不回答」機制(Aleph Alpha 的 Merlin-Arthur protocol),這對政府跟醫療特別重要

Kolibri 在他們自己設計的 benchmark 上(汽車供應商、半導體、德國公部門、工業驅動、航太)從 Kolibri Origin 開始,每個垂直領域的得分都有顯著成長:

領域Kolibri OriginKolibri
汽車供應商0.720.99
半導體0.350.80
德國公部門0.540.75
工業驅動技術0.310.60
航太0.140.59

三個月從 30B 升到 78B:「Model Factory」是怎麼辦到的?

Kolibri Origin 在 6 月 11 日完成預訓練,Kolibri 在 9 月 11 日完成,10 月 3 日開源。三個月內把模型從 30B 升到 78B、context 從 65k 拉到 1M、預訓練 token 從 7.5T 拉到 20T。

關鍵基礎建設是 Aleph Alpha 的 Model Factory:

  • Pipeline-as-code:整個訓練流程寫成程式碼,每個改動都會觸發小型 end-to-end 訓練與評測(CI/CD 思維套到模型訓練)
  • 每小時產出 checkpoint:自動評測英文與德文的知識、數學、程式碼、指令遵循、工具使用、長文本、安全、幻覺抑制
  • 自動化故障處理:21 天預訓練期間發生 38 次非預期中斷(每 10,000 GPU-hours 約 1 次),全部自動恢復,從最近的 checkpoint(最多 250 steps 前)繼續
  • 小團隊產出大產能:Kolibri Origin 整個預訓練期間「早」發現資料洗牌 bug,整個重來

官方技術報告寫得非常透明——連資料集怎麼做都詳細描述,這在主流模型發表裡是少見的。


Benchmark:跟誰比、贏多少、輸多少

Aleph Alpha 自己宣稱 Kolibri 在英文與德文都落在 Pareto frontier 上(品質 vs. 部署成本的最佳化邊界)。但 Hacker News 的討論已經指出兩個爭議點:

爭議一:跟誰比才公平?

官方選擇比較的對象是 Qwen3.6-35B-A3B、Nemotron 3 Super 120B-A12B、Mistral Small 4 119B-A6B——都不是當下最強的 MoE 模型。

HN 用戶 spijdar 質疑:「刻意不拿 Qwen3.8 Flash(另一個 6B active 的小型 MoE)比較,反而拿快一年的 Qwen3-Next 80B-A3B 比較,相當刻意。」

爭議二:Qwen3.8 27B 在德文 benchmark 上擊敗 Kolibri

HN 用戶 amoshebb 引用 Kolibri 自己的 benchmark 數據:

  • 德文 AIME 2025:Kolibri 87.5 vs Qwen3.6-35B-A3B 82.9(Kolibri 贏)
  • 德文 GPQA(diamond):Kolibri 81.3 vs Qwen3.6-35B-A3B 80.6(Kolibri 小贏)

但其他德文項目,Qwen3.8 27B 79.9 vs Kolibri 70.8,Kolibri 反而落後。這代表 Kolibri 在「德文」這個主打項目並非全面領先。

爭議三:主權定位可能站不住腳

2026 年 9 月 16 日 Aleph Alpha 已宣布與加拿大 Cohere 簽訂合併協議,將成為「第一個跨大西洋主權 AI 解決方案」。同一位 amoshebb 問:「被 Cohere 收購完成後,這個『主權』說法還站得住腳嗎?90% 由多倫多持有、100% 由多倫多營運。」

另一位 HN 用戶 tomComb 也提到:「主權跟 Cohere 合併不衝突,這是好事情——這些少數非美非中的 AI 公司真的需要共享成本與努力。」


為什麼這件事重要

Kolibri 不是「又一個 open-weight LLM」可以一句話帶過。它的戰略意義在於三件事:

1. 歐洲 AI 法案時代的「合規首選」

歐盟 AI Act 2026 年正式分階段實施,要求高風險應用(公共服務、醫療、執法)必須有透明度、文件化、可審計性。Kolibri 從一開始就把 GDPR、AI Act、版權法納入設計,Apache 2.0 授權讓企業可以合法商用、自部署、自審計——這是 Llama / Qwen / DeepSeek 沒有的「合規保證」。

2. 主權 AI 從口號變成可部署方案

過去一年「主權 AI」這個詞被各國政府(法國、德國、日本、印度、英國)喊得震天響,但真正能跑出來的開源模型很少。Kolibri 提供了一個可量產、可部署、可審計的實際方案。對歐洲公部門與工業企業來說,這是 Llama 之外的首選。

3. Model Factory 是 LLM 工程的下一個典範

「Pipeline-as-code、每小時 checkpoint、自動故障恢復」這套做法,等於把 DevOps/CI-CD 整套思維套到模型訓練。OpenAI、Anthropic 的內部基礎建設大概也是這種規模,但從來沒有公開談過細節。Aleph Alpha 這次把整個過程寫成 189 頁技術報告,是開源社群少見的 LLM 工程教科書。


數據解讀:Kolibri 的真實位置在哪裡

把 Kolibri 放進目前的開源 LLM 光譜:

面向Kolibri 強項Kolibri 弱項
德文21.3% 原生德文預訓練(行業最高)、自製雙語 tokenizer某些德文 benchmark 仍輸 Qwen3.8 27B
效率3B active / 78B total,fp8 RTX Pro 6000 跑 170 token/s比 Qwen3.8 Flash 6B active 慢
合規GDPR、AI Act、Apache 2.0 一次到位訓練資料的細節仍受質疑
生態Hugging Face 上架、可商用社群文件、教學範例仍少
長文本1M context(業界頂尖)真實長文本檢索準確率還沒第三方驗證

Kolibri 的定位很清楚:不是 AGI 競賽裡的下一個 GPT,是**「企業主權 AI」這個垂直賽道的第一個真正可用的開源方案**。對歐洲公部門、航太、汽車、半導體企業來說,這比 Llama-3.1-70B 還實用。


Siami 觀點

看好 vs. 看淡

看好的理由:

  • Kolibri 不是單純模型發表,是整套歐洲 AI 主權方案的實踐樣板
  • 技術報告的透明度是開源社群多年來少見的(189 頁從資料集到架構到評測全公開)
  • Model Factory 的工程思維是 LLM 量產化的關鍵基礎
  • Apache 2.0 授權明確,企業商用無負擔

看淡的理由:

  • 「主權」定位可能在 Cohere 收購後站不住腳——官方聲明稿完全沒提 Cohere
  • Benchmark 比較對象刻意挑選,避開了更強的 Qwen3.8 Flash
  • HN 上已經有開發者反映「過度思考」問題(簡單問題消耗過多 token)
  • 「21.3% 德文預訓練 token」這個數字在 Llama-3.1(德文 < 1%)、Qwen3.6(德文 ~5%)面前確實驚艷,但實際德文任務表現仍非全面領先

誰應該用 Kolibri?

  • ✅ 歐洲公部門、金融監理、醫療、航太、汽車供應商——需要主權、可審計、可離線的場景
  • ✅ 需要處理大量德文文件的企業(汽車工業文件、技術手冊、合約)
  • ✅ 想學 LLM 工程化量產的團隊——技術報告值得讀完
  • ❌ 追求最強通用 benchmark——Qwen3.8、DeepSeek-V4 仍更強
  • ❌ 純英文應用——Kolibri 的英文優勢不明顯,Llama-3.1 / Qwen3.6 仍是更好選擇
  • ❌ 個人開發者 / 預算有限——78B 仍需大量 GPU 資源(除非用雲端推論服務)

怎麼開始用 Kolibri


編按:本文由 Siami 編輯部綜合整理自 Aleph Alpha 官方部落格、技術報告、Hacker News 討論串(382 分、252 則留言)、Hugging Face 模型卡與 tej.as 深度分析。我們重新整理技術細節、benchmark 比較、商業脈絡,並加入編輯部觀點判斷每項數據的可信度,協助讀者判斷這個模型是否符合自己的需求。如有疑問歡迎留言。

網友熱門留言 (7)

#1 miellaby ▲ 187
技術報告把所有細節都寫出來了,包括資料集怎麼做的。這是我第一次看到這種程度的開放性。
#2 peterBlue75 ▲ 142
除了透明度跟模型本身品質之外,重點是這是一個成立不到一年的團隊做的第一次 release,迭代速度很快。後續還會有更多。
#3 kkm ▲ 98
謝謝 Aleph Alpha 開源!我們把 Kolibri-1 架起來免費讓大家試玩幾天,不用 GPU、不用設定。
#4 amoshebb ▲ 76
Qwen3.8 27B 在德文項目以 79.9 比 70.8 擊敗 Kolibri(用 Kolibri 自己的 benchmark)。另外 Cohere 收購完成後,這個『主權』說法還站得住腳嗎?
#5 spijdar ▲ 64
刻意不拿 Qwen3.8 Flash(另一個小型 MoE)比較,反而拿一年前發布的 Qwen3-Next 80B-A3B 比較,相當刻意。
#6 martianvoid ▲ 52
我在 RTX Pro 6000 上跑了,它會在簡單問題上過度思考(消耗太多 token),但用 fp8 跑 3B active 可以到 170 token/s,速度不錯。
#7 niemandhier ▲ 47
現在主權 AI 模型最需要做的是審計其他模型的結果。你可以跑開放模型給政府用,但沒人敢相信它的輸出。所以讓一個受控的主權模型審計第一個模型,就像『信任轉接器』。