← 返回 Siami 首頁

Mistral OCR 4.1 升級上線:從「讀文字」變「讀結構」,企業文件 AI 進入可定址時代

▲ 205 💬 82
Mistral OCR 4.1 升級上線:從「讀文字」變「讀結構」,企業文件 AI 進入可定址時代

編按:本文綜合整理自 Mistral 官方 OCR 4 公告、Mistral Changelog、VentureBeat 報導 及 Hacker News 討論串(OCR 4、OCR 4.1),並加入 Siami 編輯部觀點與分析。

法國 AI 公司 Mistral 在 8 月 13 日悄悄把官方文件站的 OCR 預設版本從 OCR 4.0 換成了 7 月 16 日發布的 OCR 4.1,把 mistral-ocr-latest 與 mistral-ocr-4 兩個 endpoint 都指到新模型。HN 上的討論串在一天之內衝到 401 分、160 則留言,延續 6 月 23 日 OCR 4 發布時的熱度(OCR 4 當時拿到 501 分、136 則留言)。OCR 4.1 本身是小升級,補上 block-level confidence scores 顆粒度,真正的賣點仍是 Mistral 從這一代開始把「文件 OCR」重新定義成「文件理解」這件事。

從「讀文字」升級成「讀結構」

過去十年的 OCR 工具,多半把 PDF 或掃描檔轉成一坨純文字。Mistral OCR 4 把每一塊內容標上 bounding box、分類為 title / table / equation / signature 等結構類型,並附上 page-level 與 word-level 的 confidence score。下游系統因此能直接拿到「這段是標題、這塊是表格、信心分數 0.92」這種可定址、可索引的輸出,而不是要再寫一層 regex 去猜哪行是抬頭。

OCR 4 與前幾代最大的差別是:它不再把頁面攤平成文字牆,而是回傳文件的「語意地圖」。每個區塊都帶座標、類型標籤與信心分數,下游系統可以同時知道內容是什麼、在哪裡、扮演什麼角色、模型對它有多確定。

這對三種工作流特別關鍵:

  • RAG 語意切塊:分類好的乾淨區塊直接變成更好的檢索單位,不用再依賴固定 token 切窗。
  • Agent 結構化操作:代理人從「讀文件」升級成「對文件動手」,例如自動填表、處理發票、合規檢查。
  • 連接器與索引:一致的、有型別的輸出可以直接灌進企業搜尋、知識庫與資料管線。

定價、語言與自架選項

Mistral OCR 4 / 4.1 透過 Mistral Studio、Amazon SageMaker 與 Microsoft Foundry 提供 API,Snowflake Parse Document 整合即將上線。單價如下:

  • API:每千頁 4 美元(歐元約 €3.5)
  • Batch API 折扣 50%:每千頁 2 美元
  • Document AI(含 JSON schema + 圖片註解):每千頁 5 美元

支援格式涵蓋 PDF、DOC、PPT 與 OpenDocument,支援 170 種語言、10 個語系群,包含印地語、日語、孟加拉語、希伯來語、泰米爾語等低資源語言。對於歐洲企業與公部門,OCR 4 也可以完全自架在單一容器內,讓文件資料留在自家基礎設施,符合歐盟資料主權(data sovereignty)與 AI Act 的合規要求。

OCR 4.1 的具體差異:

  • mistral-ocr-latest 與 mistral-ocr-4 都已指向 4.1
  • OCR API 的 confidence_scores_granularity 參數新增 "block" 顆粒度,介於 "page" 與 "word" 之間

跑分漂亮,但官方也承認基準有瑕疵

Mistral 公布了三組分數:

項目成績備註
OlmOCRBench85.20公開基準,整體排名第一
OmniDocBench93.07公開基準,強在複雜版面
Crawl Multilingual(內部)0.98跨 8 個語系群皆領先
人類偏好盲測72% 平均勝率600+ 份真實文件、12+ 種語言

但官方自己也寫了兩段「免責聲明」:

  • Ground-truth 錯誤:部分參考標註本身就是錯的,例如作者姓名在參考答案裡拼錯,但模型從原圖讀對,仍被算錯。
  • 數學式 LaTeX 等價:渲染結果一樣的字串被視為 mismatch,原因是字串比對邏輯沒辦法處理數學符號的等價轉寫。
  • 多欄閱讀順序:例如「certifi-cates」被切到跨欄時,模型讀對,計分器算錯。
  • 區塊類型歸屬:測試基準不預期 header/footer 出現在輸出,所以 Mistral 先把這兩塊過濾掉再送評分,卻反而讓標題誤判。

因此 Mistral 自己結論是「把 aggregate 數字視為方向性而非定論」,並建議客戶用自己的真實文件測。

為什麼這件事重要

OCR 4 / 4.1 不只是一個新版本,它把 OCR 從「文件前處理」變成「企業 AI 的入口」。

第一,bounding box + block classification 讓 LLM 第一次能「引述」文件內容。沒有座標,RAG 系統只能給出「在某文件中找到這段」;有了座標,模型可以回答「這段位於第 3 頁右側表格第 2 欄」,律師、會計師、稽核人員可以直接把這段當證據。Siami 編輯部認為,這是把企業文件從「可搜尋」推進到「可引用」的關鍵一步。

第二,歐洲企業有了「非美非中」的全棧選項。Mistral 把模型、推理、文件 AI、自架容器、Microsoft Foundry 與 AWS SageMaker 通路綁在一起。在 Anthropic 出口管制爭議未解、Google Document AI 屬美、阿里 / 百度 / 字節屬中的格局下,巴黎出身的 Mistral 是少數能同時滿足「歐洲合規 + 企業級 SLA + 多元雲部署」三項條件的供應商。HN 留言串就有人直接說:「這不是法規要求,是歐洲企業真的擔心美中供應商的資料主權。」

第三,Mistral 的「文件 → 搜尋 → RAG → Agent」全棧正在成形。OCR 4 已是 Mistral Search Toolkit 的攝取元件,Search Toolkit 是 6 月 AI Now Summit 公布的開源搜尋框架。一旦企業把 OCR 4 接進自家文件庫,後續的 retrieval、citation、agent orchestration 都會自然落到 Mistral 的工具鏈上,形成類似 Snowflake / Databricks 的「資料落地、計算也落地」鎖定效應。

數據解讀與質疑

不過要把 Mistral 的官方數字放到實際採購決策前看,還有幾個地方要打折扣:

  • 72% 人類偏好勝率是內部實驗,文件集由第三方供應商提供、評分者也是 Mistral 請來的獨立標註員。VentureBeat 引述第三方獨立驗證(PaddleOCR-VL 92.86 vs Mistral OCR 3 79.75 on OmniDocBench)顯示在表格 TEDS 這個關鍵指標上,Mistral 仍落後百度開源的 PaddleOCR-VL 約 14 分。對需要從表格抽取結構的場景(保險理賠、財報、報關單),這個差距不是「方向性」可掩蓋的。

  • HN 上實際使用者回報混雜。SyneRyder 指出 Mistral OCR 4.0「會在頁面中無中生有編造整個句子」,必須再用 Claude 校稿才能上線;ComputerPerson 跑古籍掃描(Fraktur、上標下標、難字)認為「沒有為這種細活特別突出」;kergonath 反而對老排版 + 打字機混手寫讚譽有加。同樣叫 OCR 4.0,三個人講三種故事,差別在文件類型與容錯標準。

  • 價格並非市場最低。自建 GPU pipeline 的開發者在 HN 直接報價:1000 頁 0.05–0.10 美元,每頁 0.8 秒,帶完整 bounding box。對每天跑 10 萬頁以上、且不需要 Mistral 多語言或合規優勢的廠商,3.5 美元 1000 頁的差距是 70 倍以上。

  • 官方「免責聲明」其實是警訊。Mistral 把 OlmOCRBench 與 OmniDocBench 的評分邏輯拿出來一條一條檢視,結論是「基準評分對正確輸出與錯誤輸出的懲罰不對稱」。這代表目前公開基準對 OCR 模型的鑑別力正在衰減,未來企業若要認真選型,必須自己做黃金測試集。

  • OCR 4.1 的「升級」幅度很小。Mistral 在 7 月 16 日釋出 4.1,僅新增 block 信心分數顆粒度,並沒有改 inference 行為或訓練配方。HN 之所以 8 月 13 日才衝分,是因為「4.1 變成 latest 預設」這件事被官方文件站揭露。也就是說,今天大家在討論的「4.1」,實務上跟 6 月發表的 4.0 是同一顆模型加上一個新開關,企業可以暫時把這視為 4.x 系列的小修補。


官方影片:Mistral 在 6 月 23 日釋出 OCR 4 的官方介紹影片,由研究團隊 Pravesh 與 Kayla 主講,內容涵蓋 bounding box、block classification 與 Document AI 整合示範。

延伸閱讀:


Siami 編輯部觀點:OCR 4 / 4.1 不是新技術,而是新介面。當 OCR 開始回傳「座標 + 結構 + 信心分數」,企業文件就不再是文字牆,而是可定址、可引用、可審計的結構化資料。接下來 6–12 個月值得關注的不是「Mistral 又發了什麼模型」,而是歐洲企業是否真的會把文件 AI 的採購預算從 Google Document AI、Azure Document Intelligence 與 AWS Textract 轉向 Mistral。Rogo、Anaqua 等早期客戶的回饋(8x 降本、17x 降延遲、4x 加速)若在更大規模的可重現測試中站穩腳步,這將是 2026 年企業 AI 採購清單上第一次出現「歐洲選項」這個欄位的關鍵一年。

網友熱門留言 (5)

#1 SyneRyder (HN) ▲ 22
同時用過 Claude 與 Mistral OCR 4.0 處理小量 OCR 工作,Claude 絕對更好。不過 Mistral 有一個優勢:Anthropic 現在會把 OCR 視為「重製」而�下,連自己有版權的文件也擋。新工作流變成 Mistral OCR 跑第一輪,Claude 校稿。Claude 雖然貴,但它抓到了 Mistral OCR 4.0 在頁面中無中生有編造出來的整個句子,這層把關救了一次。
#2 ComputerPerson (HN) ▲ 41
一直用新模型跑古籍掃描。連字、批判性記號、Fraktur 字型、上標下標,這種細活 Mistral 沒特別突出。OpenAI 的 pro 模型在這個維度碾壓,畢竟價差在那,但還是希望 OCR 專用模型能做得更好。
#3 kergonath (HN) ▲ 12
處理老排版、掃描品質不佳、有時候排版很複雜甚至類打字機混手寫的文件,Mistral OCR 一直讓我很滿意。沒辦法每出新模型都測,但 Mistral OCR 3 出的時候跑過一輪,便宜、快、不用再後處理,CP 值很好。
#4 enterprise-user (HN) ▲ 14
在做高量招標文件場景,每天處理十萬頁以上。不需要識別 1930 年代的手寫稿,都是 PDF / DOC / 掃描的印刷頁。準確度不錯,bounding box 是用 LLM 建答案時做 grounding 的必要配備。Tesseract 在那個量級太慢、表格跟圖也認不夠好。
#5 self-hosted-vendor (HN) ▲ 7
在租的 GPU 上跑自建 OCR pipeline,1000 頁大約 0.05 到 0.10 美元,每頁約 0.8 秒,帶完整 bounding box 支援做 grounding。3.5 美元 1000 頁真的貴到不行⋯⋯