← 返回 Siami 首頁

Mistral OCR 4 開源:170 種語言 + 邊界框 + 區塊分類,企業文件 AI 直接部署在自己的機房

▲ 375 💬 97
Mistral OCR 4 開源:170 種語言 + 邊界框 + 區塊分類,企業文件 AI 直接部署在自己的機房

編按:本文綜合整理自 Mistral AI 官方部落格《Mistral OCR 4 : SOTA OCR for Document Intelligence》、OlmOCRBench 公開基準,以及 Hacker News 與 Tech Expert Tutorials 等產業評論,並加入 Siami 編輯部對 2026 年 OCR 賽道(DeepSeek-OCR、Baidu Unlimited OCR、PaddleOCR-VL)的橫向觀察。

Mistral 在 2026 年 6 月 23 日的 AI Now Summit 上正式釋出 Mistral OCR 4。這個版本跳脫「把圖轉成文字」的傳統 OCR 想像,主打 SOTA 文件智慧(Document Intelligence)——除了文字,還會回傳邊界框(bounding boxes)、區塊分類(block classification)和逐字信心分數(inline confidence scores)。官方同時宣布 OCR 4 整合進自家開源搜尋框架 Mistral Search Toolkit,定位為 RAG 與企業搜尋的進料層。

關鍵規格:

  • 170 種語言橫跨 10 個語系,特別強化低資源與專業領域語言
  • 單一容器即可自架:保留文件資料在企業自家環境,滿足資料落地(data residency)、主權與合規需求
  • 支援高吞吐批次處理:成本可控的批次模式,適合企業級文件數位化

Mistral OCR 4 的三大核心突破

這次更新不是「OCR 3 改個數字」,而是把 OCR 從「轉文字」升級成「理解文件結構」。

**第一,邊界框回傳。**這是 Mistral 官方說「最多人許願」的功能。模型不只告訴你「這一頁有『營收 1.2 億』這行字」,還會回傳 [x, y, width, height] 座標,告訴你這行字在文件哪個位置。下游可以拿來做:

  • 內文標註(in-context highlighting):AI 回答時把引用段落高亮起來
  • 可靠的資料管線:表格欄位對齊、發票欄位擷取、合約條款定位
  • 來源可追溯的引用:每個答案都能反查回原始文件的具體區塊

**第二,區塊分類與信心分數。**OCR 4 會把文件切成不同類型的區塊——標題、表格、方程式、簽名、圖說、頁首頁尾、註腳等,每塊都帶信心分數。這對下游應用至關重要:

  • 代理人(agent)層:不再只是「讀」文件,而是能「動」文件(form filling、invoice processing、compliance check)
  • 連接器與結構化輸出:把 OCR 結果直接餵給下游 ETL 與商業流程
  • 人機協作驗證:信心分數低的區塊可由人工覆核,信心高的直接放行

**第三,深度整合 Mistral Search Toolkit。**OCR 4 是這個開源、可組合搜尋框架的進料元件。結構化輸出(邊界框 + 區塊類型 + 信心分數)會直接轉成 citation-ready 的檢索單元,整條管線從原始 PDF 到 RAG 答案可以一次串完。

為什麼這件事重要

OCR 賽道 2026 年突然變得非常擁擠。PaddleOCR-VL-1.6 在 OmniDocBench v1.6 拿到 96.33 分穩居第一(5 月榜),DeepSeek-OCR-2、GLM-OCR、MinerU2.5-Pro 都擠在 95 分附近。但 Mistral OCR 4 走了一條不一樣的路——它不是要刷 benchmark 第一,而是把 OCR 從「純粹的視覺任務」轉成「企業文件 AI 的基礎設施」

這個定位差異有三層意義:

  1. 企業客戶在乎的不是 headline 分數,是結構化輸出。同樣是 95 分,PaddleOCR-VL 只給你文字,Mistral 給你邊界框 + 區塊分類 + 信心分數。對要做表單自動化、發票處理、合約審閱的企業來說,後者直接省下三個月的工程時間。
  2. 自架能力是歐洲企業的硬需求。Mistral 是法國公司,OCR 4 的「單一容器自架」設計直接對應歐洲企業對資料落地的監管壓力(GDPR、AI Act)。DeepSeek-OCR 與 Baidu Unlimited OCR 都開源,但多部署在中國雲端或需要較大硬體規格,歐洲企業較難直接採用。
  3. 搜尋整合是商業護城河。Mistral 把 OCR 4 鎖進 Search Toolkit,等於讓採用者很難單獨換掉——一旦文件進料管線綁死,要換全家桶的成本極高。這跟 AWS 把 OCR 鎖進 Textract 是同一套邏輯。

數據解讀與質疑

官方公布的 benchmark 數字很漂亮,但魔鬼藏在細節裡:

**OlmOCRBench 85.20 分是什麼水準?**這是 Mistral 內部維護的基準(OlmOCR),不是業界通用的 OmniDocBench。在 OmniDocBench v1.6 上,PaddleOCR-VL-1.6 拿到 96.33、MinerU2.5-Pro 拿到 95.69、GLM-OCR 約 95。Mistral 沒公布 OCR 4 在 OmniDocBench 的分數,這個缺席本身就說明了一些事。

**72% 偏好率怎麼算的?**Mistral 強調「獨立標註者更偏好 OCR 4」,平均勝率 72%。但這是 pairwise 比較(OCR 4 vs 其他系統),不是絕對分數。在 LLM-as-judge 的評測中,這種 pairwise 通常會偏向「看起來更結構化、看起來更像完整文件」的輸出,這對 Mistral 這種「給完整結構」的模型有利。

**「170 種語言」的實用性?**支援語言數 ≠ 實用品質。Mistral 提到「在低資源與專業領域語言上有可測量進步」,但沒列出哪些語言的進步幅度最大。對台灣企業來說,繁體中文 + 台語(閩南語)的處理品質才是重點,這部分 Mistral 沒提供具體測試數據。

Siami 編輯部的判斷:OCR 4 對企業客戶是有意義的升級,但對純技術玩家不是「必裝」的東西。如果你已經用 PaddleOCR 或 DeepSeek-OCR 跑得順,OCR 4 帶來的邊界框 + 區塊分類要重新整和進管線,CP 值需要實際專案評估。

業界怎麼看?Hacker News 討論重點

Mistral OCR 4 在 HN 拿下 375 分、97 則留言,主流聲音有三種:

「終於等到邊界框!這是 PaddleOCR 一直沒給的東西。」 — ocr_dev_2026 HN 上不少開發者表示「OCR 4 的邊界框功能值得付費」,因為 PaddleOCR 雖然開源但沒有原生 bounding box API,要自己做 layout detection 再對齊,極為痛苦。

「自架單一容器對歐洲企業是殺手鐧,但對美國企業沒差。」 — sre_mistral 留言區有網友指出 Mistral 的「單一容器自架」設計對 GDPR 高度敏感的歐洲企業特別有吸引力,但在美國市場大家早就習慣把文件丟上 AWS Textract 或 Google Document AI,自架反而是負擔。

「benchmark 分數比 PaddleOCR-VL 低,但結構化輸出比 PaddleOCR 好 100 倍——這是 trade-off。」 — ocr_researcher 這個觀點被多人附議。OCR 賽道已經從「刷 benchmark」演進到「看誰的結構化輸出更好用」的階段,Mistral 顯然押對了後者的需求。

結論:OCR 4 是 Mistral 的企業戰略錨

Mistral 從 2024 年開始強調「歐洲 AI 主權」,OCR 4 是這個敘事的第一個真正可商業化的產品錨點。它不是開源社群最愛的「突破性研究」,但它是企業 CTO 會認真考慮的「可落地基礎設施」。

對 Siami 的讀者來說,重點不是 Mistral OCR 4 是不是 SOTA(它可能不是),而是 OCR 這個品類正在從「視覺任務」變成「企業 AI 基礎設施」。當你的下游應用需要可靠的結構化文件輸出(不只是文字),OCR 4 跟同類產品(PaddleOCR-VL、DeepSeek-OCR-2、GLM-OCR)的設計哲學差異,就會直接影響你的系統架構。

如果你是企業架構師,正在評估 OCR 升級路徑,建議把 OCR 4 跟 PaddleOCR-VL-1.6、DeepSeek-OCR-2、GLM-OCR、Mistral Document AI API 一起做 POC。不要只追 headline 分數,要實際用你的真實文件(合約、發票、研究報告)跑一輪,看哪家的結構化輸出最貼近你的下游需求。


相關閱讀

網友熱門留言 (5)

#1 ocr_dev_2026 (HN) ▲ 187
終於等到 bounding box!這是 PaddleOCR 一直沒原生給的東西,我們公司花了半年自己接 layout detection + 對齊,痛苦死了。Mistral 這個 API 直接回傳座標,下游工程時間省下三個月有找。
#2 sre_mistral (HN) ▲ 142
單一容器自架對歐洲企業是殺手鐧,對美國企業沒差。GDPR + AI Act 壓力下,AWS Textract 跟 Google Document AI 都不行,這個 release 對德國、法國、北歐的金融與製藥客戶會很有吸引力。
#3 ocr_researcher (HN) ▲ 98
benchmark 分數比 PaddleOCR-VL 低,但結構化輸出好 100 倍——這是 trade-off。OCR 賽道已經從刷分數演進到『看誰的結構化輸出更好用』的階段,Mistral 押對了後者的需求。
#4 aiweekly_editor (X) ▲ 64
Mistral Search Toolkit 的綁定策略很聰明:一旦文件進料管線用 OCR 4 串起來,要換全家桶的成本極高。AWS Textract + Kendra、Azure Document Intelligence + Cognitive Search 都是同一套邏輯,鎖定企業客戶。
#5 tw_enterprise_arch (PTT) ▲ 47
台灣金融業最在乎繁體中文 + 表格處理,這部分 Mistral 沒給具體測試數據。建議等在地廠商(如中研院 CKIP)做 POC 報告出來再決定要不要導入,不然一換下去發現中文合約處理掉鏈就麻煩了。