編按:本文綜合整理自 Mistral AI 官方公告、CNBC 報導、The Next Web 與 Hacker News 討論串,並加入 Siami 編輯部觀點與分析。
法國 AI 新創 Mistral 在 10 月 6 日端出年度旗艦模型 Mistral Large 4(ML4),內部暱稱「Le Chonk」。這是一個擁有 1.05 兆總參數、49 億啟動參數的原生多模態 MoE 架構模型,並罕見地以「公開權重」形式釋出——而且訓練全程在 Mistral 自家位於歐洲的資料中心,使用 3,800 顆 NVIDIA Grace Blackwell GPU。
這個模型不只是參數量級的升級,更被定位為 Mistral 在 9 月完成 €30 億 Series D(歐洲科技史上最大單輪募資)後的第一個重要里程碑。Mistral 在公告中直接挑明:在所有「美國或歐洲開發」的開源權重模型中,ML4 是最強的一款。
為什麼這件事重要
「開源權重」四個字,在 2026 年的 AI 市場上幾乎已經變成歐洲與中國的專屬賽道。美國這邊,OpenAI、Google、Anthropic 全部走閉源 API 路線;歐洲過去雖然有 Mistral 跟幾家學術機構撐著,但始終拿不出對標 GPT-5 等級的旗艦模型。直到 Le Chonk 亮相——這是第一個真正具備 frontier 等級能力、又完全開源權重、且部署在歐洲主權基礎設施上的模型。
對企業客戶來說,「開源權重 + 歐洲主權部署 + 資安強項」這三個標籤同時成立的模型,過去從來沒出現過。
換句話說,一個歐洲的金融機構、製藥公司或政府機關,現在可以在自家機房跑一個對標 GPT-5 級的模型,而且不需依賴任何美系供應商。這在 GDPR、歐盟 AI Act 跟數位主權(digital sovereignty)成為主流監理語言的當下,不只是技術新聞,更是地緣政治訊號。
模型架構與訓練規模
ML4 的核心規格如下:
- 總參數量:1.05 兆(1.05T)
- 啟動參數量:49 億(49B)——這代表每個 token 推理時只動用約 4.6% 的權重
- 訓練硬體:3,800 顆 NVIDIA Grace Blackwell GPU
- 訓練地點:Mistral 歐洲自建資料中心(位於法國,細節未公開)
- 上下文長度:1M tokens
- 多語覆蓋:160+ 種語言,包含所有歐盟官方語言
- API 價格:輸入 $1.36 / 百萬 tokens,輸出 $4.18 / 百萬 tokens
特別值得注意的是訓練資料的多元性。Mistral 強調 ML4 的訓練資料有相當比例是多語內容,並與金融、工程、製造、物流、製藥、科學、海運、公共部門等領域的企業深度合作。這跟純粹從網路爬蟲訓練出來的中國開源模型(如 DeepSeek、Qwen)在資料組成上有明顯差異。
五大能力評測結果
Mistral 在公告中列出 ML4 在多個獨立基準上的表現。這些測試結果由 Artificial Analysis、Vals AI、HarveyAI、Lakera 等第三方機構執行,以下是重點摘錄:
1. 資安(Cybersecurity)
在 Artificial Analysis Cyber Index(評估 AI 找修真實漏洞的能力)中,ML4 排名全球前五,在所有「非中國開發」的開源權重模型中遙遙領先。
- 真實漏洞重現 + 修補測試:ML4 拿到 82%,所有模型最高
- Cybench 資安競賽題庫:93%,開源權重模型中最高
- Lakera B3 對抗攻擊防禦率:93.3%,沒有更高分
對比 Claude Opus 5.5 跟 GPT-6 Astra 在同一個漏洞重現測試中「幾乎是 0 分」——因為它們的 safety filter 會直接擋掉「請重現這個漏洞」的指令。ML4 沒這個限制。
這個差異對企業內部的紅隊演練、漏洞研究、SOC 自動化來說是巨大的。Mistral 強調:威脅行為者正在用 jailbreak 突破閉源模型的安全限制來做攻擊,防禦方需要的是能跟攻擊方能力對等、又不被同樣限制綁死的系統。
2. 程式設計(Agentic Coding)
ML4 在以下基準拿到 SOTA 等級的開源權重成績:
- DeepSWE v1.1:61.7%
- SWE-Atlas-QnA:59.4%
- Terminal-Bench 4:28.3%
- Coding Agent Index 綜合分:49.8%,勝過 DeepSeek V4 Pro 0813 與 Qwen 3.8 Max
在盲測人類評比(Surge AI 主持,1-5 分制)中,ML4 Preview 拿到 3.74 分,排名五個模型中的第二名,僅次於 Claude Opus 5(4.22 分),贏過 Kimi K3、GLM-5.3 跟 GLM-5.2。
3. Agentic Workflows(代理工作流)
- AutomationBench:59.9%,勝 Kimi K3、MiMo-V2.6-Pro、DeepSeek V4 Pro
- AA-Briefcase(長時程知識工作 Elo):1,393,勝 DeepSeek V4 Pro
4. 多模態
ML4 強調視覺理解,特別是視覺定位(visual grounding)——在 Dense 200 基準上以 42% 對 41% 略勝 GPT-6-Astra。其他能力包含:
- 衛星影像分析(支援災害應變)
- 工程圖紙細節檢查
- PDF 證據檢索
- 大規模地理空間影像掃描
5. 科學與數學
在開源權重模型中,SciCode-Verified 達到 SOTA,並能一鍵生成完整的 Hartree-Fock 量子化學模擬(多步驟進階化學任務)。
資安定位:刻意不做「保護型拒絕」
ML4 在資安基準上特別突出,這並非偶然。Mistral 明確把這定位成產品差異化策略:
「在資安場景,provider-level 的拒絕會擋掉合法的漏洞研究跟事件應變;而且在事件進行中失去模型能力,本身就會變成一個嚴重的資安風險。」——Mistral 官方公告
這個說法直接挑戰 OpenAI、Anthropic、Google 的安全策略。三家美國供應商在 2025-2026 年陸續把「禁止重現漏洞」「禁止產出可利用 exploit」寫進 safety filter,理由是擔心模型被武器化。Mistral 反向操作:他們把模型權重開放,讓客戶在自己的基礎設施上跑,並接受客戶自己設定的可接受使用政策——Mistral 不在雲端做事後審查。
對企業 SOC 跟資安研究機構來說,這是一個完全不同的工作流模式:
- ✅ Mistral 路徑:自己跑、自己審計、不依賴供應商
- ❌ 閉源 API 路徑:每次呼叫都可能被擋、可能被限速、可能被改政策
不過這個策略也帶來監理風險——歐盟 AI Act 對「高風險 AI 系統」有嚴格要求,允許客戶自部署資安模型會踩到哪些紅線,目前還沒有明確判例。
數據解讀與質疑
雖然 Mistral 的公告非常完整,但有幾個地方讀者需要保留警覺:
-
「全球前五」的定義模糊:Artificial Analysis Cyber Index 的排名是基於特定測試集,跟一般認知的「最頂尖模型」不一定吻合。CNBC 報導引述的「rival best open model」措辭也很微妙——避談了「是否超越閉源旗艦」這個問題。
-
Vals AI 產業基準 48.05% 沒贏:在更貼近真實業務場景的 Vals AI 評測中,ML4 拿到 48.05%,排名在 Qwen 3.8 Max 跟 MiniMax-M3 之後。這跟「最強開源模型」的行銷說法有些落差。
-
這是 Preview,RL 還沒跑完:Mistral 自己承認目前的強化學習訓練仍在進行,模型「尚未飽和」。月底權重釋出時,benchmark 數字可能會再上一階——但也可能往下降。
-
開源不等於免費:1.05T 參數即使以 4-bit 量化部署,仍需要約 500GB VRAM。這不是一般企業或個人能跑的規模。所謂「開源」,在實務上仍然是有大型 GPU 叢集的組織才能受惠。
-
安全性資料未公開:Mistral 沒有公開 KORABench、Lakera B3 等基準的完整測試方法,也沒有公開模型被紅隊演練找到問題的數量。在一款「刻意降低 safety filter」的模型上,這些資訊的透明度比一般模型更重要。
部署與時程
- 現在:可在 Mistral Studio 試用 Preview API
- 2026 年 10 月底:正式釋出權重,公開更多架構、benchmark 跟後訓練方法細節
- 後續:ML4 將作為基礎,推出「新一代針對特定產業與工作負載優化」的 Mistral 模型
目前公告中沒有提到 Apple Silicon、AMD ROCm 或其他非 NVIDIA 硬體的部署計畫。對開源社群來說,「能不能在家用 GPU 跑 49B 啟動參數的子集」是接下來最關鍵的問題。
結語:主權 AI 的第一張真牌
Mistral Large 4 不只是技術里程碑,更是歐洲 AI 主權論述的具體實現。當 CNBC、The Next Web 等主流媒體都把焦點放在「歐洲挑戰美中 AI 霸權」時,Le Chonk 確實是目前唯一有 frontier 級能力、完全開源、又部署在歐洲主權基礎設施的模型。
但讀者也要記住:這是 Preview 版本、Vals AI 產業基準排名其實不算頂尖、月底權重釋出時還可能再改。現在下結論還太早——真正的考驗,會在月底權重開放下載、社群開始部署、第三方獨立評測完整公布之後。
在那之前,ML4 是一個值得關注、但暫時還不該被當作「美中 AI 霸權終結者」來過度吹捧的模型。
編按:本文綜合整理自 Mistral AI 官方公告、CNBC 報導、The Next Web 與 Hacker News 討論串,並加入 Siami 編輯部觀點與分析。
網友熱門留言 (5)