編按:本文綜合整理自 Aleph Alpha 官方部落格、Hacker News 討論串(382 分、252 則留言)、Kolibri 技術報告 PDF、Hugging Face 模型卡、tej.as 深度分析,並加入 Siami 編輯部觀點與分析。
事件:德國統一日開源、Apache 2.0、3B active 跑 78B 模型
2026 年 10 月 3 日(也是德國統一紀念日),總部位於德國海德堡的 AI 公司 Aleph Alpha 正式開源釋出 Kolibri——一款主打「主權 AI(Sovereign AI)」定位、英德雙語的 Mixture-of-Experts(MoE)大型語言模型,採用 Apache 2.0 授權釋出完整權重。
Kolibri 的核心規格:
- 總參數量 78.1B,每次推論只啟動 3.46B 參數
- 上下文長度最高 100 萬 token(可處理整本書或大型程式碼庫)
- 預訓練 token 數 20 兆(20T),原始資料處理量超過 200 兆 token
- 德文佔預訓練 token 的 21.3%,刻意「不用翻譯資料灌德文」(僅 6% 翻譯)
- 在 Hugging Face 開放完整模型權重(Aleph-Alpha/Kolibri-1)
Kolibri 是我們 Model Factory 出廠的第二個模型,距離第一個 Kolibri Origin(30B)只相隔三個月。我們的目標是讓歐洲公共部門、航太、工業企業能在自己的機房裡跑 LLM,不必把內部資料送到第三方推論服務。
—— Aleph Alpha 官方部落格
什麼是「主權 AI」?為什麼 Aleph Alpha 要把模型定位在這裡?
Aleph Alpha 把「主權」拆成兩個維度:
1. 建造主權:從頭到尾都在歐洲法律管轄下完成
- 訓練資料整理、預訓練、後訓練、優化全在德國與芬蘭的基礎設施上跑
- 整個 pipeline 遵守 歐盟 AI Act、GDPR、通用 AI 行為準則(GPAI Code of Practice)
- 沒有任何外國實體的決策權介入
2. 部署主權:客戶端可離線、可控管、可審計
- 3B active / 78B total 的設計是關鍵——足夠小,企業可以單機或自有機房部署
- 不用把公司機密、政府文件、病人病歷傳到 OpenAI / Anthropic / Google 的雲端
- 模型內建「我不懂就不回答」機制(Aleph Alpha 的 Merlin-Arthur protocol),這對政府跟醫療特別重要
Kolibri 在他們自己設計的 benchmark 上(汽車供應商、半導體、德國公部門、工業驅動、航太)從 Kolibri Origin 開始,每個垂直領域的得分都有顯著成長:
| 領域 | Kolibri Origin | Kolibri |
|---|---|---|
| 汽車供應商 | 0.72 | 0.99 |
| 半導體 | 0.35 | 0.80 |
| 德國公部門 | 0.54 | 0.75 |
| 工業驅動技術 | 0.31 | 0.60 |
| 航太 | 0.14 | 0.59 |
三個月從 30B 升到 78B:「Model Factory」是怎麼辦到的?
Kolibri Origin 在 6 月 11 日完成預訓練,Kolibri 在 9 月 11 日完成,10 月 3 日開源。三個月內把模型從 30B 升到 78B、context 從 65k 拉到 1M、預訓練 token 從 7.5T 拉到 20T。
關鍵基礎建設是 Aleph Alpha 的 Model Factory:
- Pipeline-as-code:整個訓練流程寫成程式碼,每個改動都會觸發小型 end-to-end 訓練與評測(CI/CD 思維套到模型訓練)
- 每小時產出 checkpoint:自動評測英文與德文的知識、數學、程式碼、指令遵循、工具使用、長文本、安全、幻覺抑制
- 自動化故障處理:21 天預訓練期間發生 38 次非預期中斷(每 10,000 GPU-hours 約 1 次),全部自動恢復,從最近的 checkpoint(最多 250 steps 前)繼續
- 小團隊產出大產能:Kolibri Origin 整個預訓練期間「早」發現資料洗牌 bug,整個重來
官方技術報告寫得非常透明——連資料集怎麼做都詳細描述,這在主流模型發表裡是少見的。
Benchmark:跟誰比、贏多少、輸多少
Aleph Alpha 自己宣稱 Kolibri 在英文與德文都落在 Pareto frontier 上(品質 vs. 部署成本的最佳化邊界)。但 Hacker News 的討論已經指出兩個爭議點:
爭議一:跟誰比才公平?
官方選擇比較的對象是 Qwen3.6-35B-A3B、Nemotron 3 Super 120B-A12B、Mistral Small 4 119B-A6B——都不是當下最強的 MoE 模型。
HN 用戶 spijdar 質疑:「刻意不拿 Qwen3.8 Flash(另一個 6B active 的小型 MoE)比較,反而拿快一年的 Qwen3-Next 80B-A3B 比較,相當刻意。」
爭議二:Qwen3.8 27B 在德文 benchmark 上擊敗 Kolibri
HN 用戶 amoshebb 引用 Kolibri 自己的 benchmark 數據:
- 德文 AIME 2025:Kolibri 87.5 vs Qwen3.6-35B-A3B 82.9(Kolibri 贏)
- 德文 GPQA(diamond):Kolibri 81.3 vs Qwen3.6-35B-A3B 80.6(Kolibri 小贏)
但其他德文項目,Qwen3.8 27B 79.9 vs Kolibri 70.8,Kolibri 反而落後。這代表 Kolibri 在「德文」這個主打項目並非全面領先。
爭議三:主權定位可能站不住腳
2026 年 9 月 16 日 Aleph Alpha 已宣布與加拿大 Cohere 簽訂合併協議,將成為「第一個跨大西洋主權 AI 解決方案」。同一位 amoshebb 問:「被 Cohere 收購完成後,這個『主權』說法還站得住腳嗎?90% 由多倫多持有、100% 由多倫多營運。」
另一位 HN 用戶 tomComb 也提到:「主權跟 Cohere 合併不衝突,這是好事情——這些少數非美非中的 AI 公司真的需要共享成本與努力。」
為什麼這件事重要
Kolibri 不是「又一個 open-weight LLM」可以一句話帶過。它的戰略意義在於三件事:
1. 歐洲 AI 法案時代的「合規首選」
歐盟 AI Act 2026 年正式分階段實施,要求高風險應用(公共服務、醫療、執法)必須有透明度、文件化、可審計性。Kolibri 從一開始就把 GDPR、AI Act、版權法納入設計,Apache 2.0 授權讓企業可以合法商用、自部署、自審計——這是 Llama / Qwen / DeepSeek 沒有的「合規保證」。
2. 主權 AI 從口號變成可部署方案
過去一年「主權 AI」這個詞被各國政府(法國、德國、日本、印度、英國)喊得震天響,但真正能跑出來的開源模型很少。Kolibri 提供了一個可量產、可部署、可審計的實際方案。對歐洲公部門與工業企業來說,這是 Llama 之外的首選。
3. Model Factory 是 LLM 工程的下一個典範
「Pipeline-as-code、每小時 checkpoint、自動故障恢復」這套做法,等於把 DevOps/CI-CD 整套思維套到模型訓練。OpenAI、Anthropic 的內部基礎建設大概也是這種規模,但從來沒有公開談過細節。Aleph Alpha 這次把整個過程寫成 189 頁技術報告,是開源社群少見的 LLM 工程教科書。
數據解讀:Kolibri 的真實位置在哪裡
把 Kolibri 放進目前的開源 LLM 光譜:
| 面向 | Kolibri 強項 | Kolibri 弱項 |
|---|---|---|
| 德文 | 21.3% 原生德文預訓練(行業最高)、自製雙語 tokenizer | 某些德文 benchmark 仍輸 Qwen3.8 27B |
| 效率 | 3B active / 78B total,fp8 RTX Pro 6000 跑 170 token/s | 比 Qwen3.8 Flash 6B active 慢 |
| 合規 | GDPR、AI Act、Apache 2.0 一次到位 | 訓練資料的細節仍受質疑 |
| 生態 | Hugging Face 上架、可商用 | 社群文件、教學範例仍少 |
| 長文本 | 1M context(業界頂尖) | 真實長文本檢索準確率還沒第三方驗證 |
Kolibri 的定位很清楚:不是 AGI 競賽裡的下一個 GPT,是**「企業主權 AI」這個垂直賽道的第一個真正可用的開源方案**。對歐洲公部門、航太、汽車、半導體企業來說,這比 Llama-3.1-70B 還實用。
Siami 觀點
看好 vs. 看淡
看好的理由:
- Kolibri 不是單純模型發表,是整套歐洲 AI 主權方案的實踐樣板
- 技術報告的透明度是開源社群多年來少見的(189 頁從資料集到架構到評測全公開)
- Model Factory 的工程思維是 LLM 量產化的關鍵基礎
- Apache 2.0 授權明確,企業商用無負擔
看淡的理由:
- 「主權」定位可能在 Cohere 收購後站不住腳——官方聲明稿完全沒提 Cohere
- Benchmark 比較對象刻意挑選,避開了更強的 Qwen3.8 Flash
- HN 上已經有開發者反映「過度思考」問題(簡單問題消耗過多 token)
- 「21.3% 德文預訓練 token」這個數字在 Llama-3.1(德文 < 1%)、Qwen3.6(德文 ~5%)面前確實驚艷,但實際德文任務表現仍非全面領先
誰應該用 Kolibri?
- ✅ 歐洲公部門、金融監理、醫療、航太、汽車供應商——需要主權、可審計、可離線的場景
- ✅ 需要處理大量德文文件的企業(汽車工業文件、技術手冊、合約)
- ✅ 想學 LLM 工程化量產的團隊——技術報告值得讀完
- ❌ 追求最強通用 benchmark——Qwen3.8、DeepSeek-V4 仍更強
- ❌ 純英文應用——Kolibri 的英文優勢不明顯,Llama-3.1 / Qwen3.6 仍是更好選擇
- ❌ 個人開發者 / 預算有限——78B 仍需大量 GPU 資源(除非用雲端推論服務)
怎麼開始用 Kolibri
- Hugging Face 模型:Aleph-Alpha/Kolibri-1
- 技術報告 PDF:189 頁 Kolibri 技術報告
- 官方部落格(本文主要來源):Kolibri Has Landed
- 免費試玩:社群 tesseracted.com/kolibri-1-chat 提供免費 chat 介面(HN 用戶 kkm 架設的)
- Cohere 合併公告:Cohere & Aleph Alpha: Transatlantic Sovereign AI
編按:本文由 Siami 編輯部綜合整理自 Aleph Alpha 官方部落格、技術報告、Hacker News 討論串(382 分、252 則留言)、Hugging Face 模型卡與 tej.as 深度分析。我們重新整理技術細節、benchmark 比較、商業脈絡,並加入編輯部觀點判斷每項數據的可信度,協助讀者判斷這個模型是否符合自己的需求。如有疑問歡迎留言。
網友熱門留言 (7)