編按:本文綜合整理自 Baidu Inc. 釋出的 GitHub 倉庫 baidu/Unlimited-OCR、配套 arXiv 論文 2606.23050,以及 Hacker News 與 X 平台相關討論,並加入 Siami 編輯部對中國開源 OCR 生態的觀察。論文一作署名為 Youyang Yin(Hugging Face ModelScope 開發者 ID 為 MurphyYin),lead director 為署名「YY」的神秘人物,社群普遍推測其為前 DeepSeek OCR 核心專家 Wei Haoran(魏浩然)。
百度(Baidu)於 2026 年 6 月 22 日悄悄在 GitHub 開源了名為 Unlimited OCR 的端到端文件解析模型,主打「One-shot Long-horizon Parsing」——意思是,模型只要一次 forward pass 就能把數十頁 PDF 文件全部解析完,過程中記憶體用量維持常數,速度不會因為頁數變多而下降。
這個模型在 Hacker News 一推出就衝到 268 分、74 則留言,arXiv 論文(編號 2606.23050)也在隔天上線。截至 6/23 為止,GitHub 倉庫已經累積 2.9k stars、184 forks,被認為是 DeepSeek-OCR 發布以來最具突破性的開源 OCR 工作。
核心創新:R-SWA 把 KV cache 鎖在常數
OCR 長期面臨一個瓶頸:當你要解析的文件越來越長,LLM 解碼器為了「記得前面寫過什麼」會把 KV cache 越積越多,記憶體暴增、生成速度線性下降。DeepSeek-OCR(2025 年 10 月)雖然用 16× 視覺壓縮改善了這個問題,但在 OmniDocBench 上超過 10K tokens 時仍會出現 model collapse,表現雪崩式下跌。
Unlimited OCR 的解法很直接:把解碼器裡所有 attention layer都換成自家研發的 Reference Sliding Window Attention(R-SWA)。R-SWA 的運作方式模仿人類抄寫文件的行為——人讀到第三段時,不需要把第一段的每個字都記住,只要參考「原始文件」加上「最近寫過的幾行」就夠了。
技術上的效果是:
- KV cache 維持常數:不管解析 1 頁還是 40 頁,GPU 記憶體用量不變
- 單次 32K forward pass 處理數十頁文件:標準 max_length 即可,不再需要切 chunk
- 推論速度比 DeepSeek-OCR 快 35%:因為 attention 計算成本是滑動窗口
- OmniDocBench v1.6 拿到 93.92%:比 DeepSeek-OCR(88%)高約 6 個百分點,創下新的 SOTA
更關鍵的是,R-SWA 不是 OCR-only 的設計——論文明確指出這個 attention 機制同樣適用於 ASR(自動語音辨識)、機器翻譯等所有「長序列對齊」任務,等於百度把一個通用模組順手開源了。
模型規模小得離譜:3B 參數、500M 激活
相比同類競品動輒 7B、13B 的視覺語言模型,Unlimited OCR 的規模意外地小:
- 總參數:3B
- 激活參數:500M(MoE 架構)
- 單張 A100/H100 即可跑:bfloat16、transformers + Hugging Face AutoModel
- 兩個解析模式:單圖用
gundam(1024 base / 640 image / crop_mode=True),多頁 PDF 用base(1024/1024/no-crop)
這個尺寸定位跟 PaddleOCR 一貫的「工業部署友善」哲學一致——百度沒有走「越大越好」的路線,而是押注在「讓企業真的能在自己的 GPU 上跑得起來」。
為什麼這件事重要
Siami 編輯部認為這次開源有三層意義:
第一,中國 OCR 開源生態的下一輪戰爭開打。 DeepSeek-OCR 在 2025 年 10 月把 end-to-end OCR 的天花板頂起來,半年後百度用 Unlimited OCR 直接在「長文件解析」這個維度超車,而且模型更小、速度更快。對手從「中國 AI 對美國閉源」的敘事,轉向「中國開源對中國開源」的內捲,這對開發者來說其實是好消息——選擇變多、價格更便宜。
第二,PaddleOCR 的工業血統加上 DeepSeek 的學術基因。 Unlimited OCR 的 lead director 署名為「YY」,社群普遍推測其為 Wei Haoran(魏浩然)——也就是 DeepSeek-OCR 的核心設計者之一。如果推測屬實,這代表百度成功挖角了 DeepSeek 的 OCR 主力,把學術界最強的 end-to-end 長序列解析能力,嫁接到 PaddleOCR 已經成熟的企業部署管道上。這是人才流動而非單純技術競爭。
第三,「頁面失憶症」從此不是問題。 過去企業要把幾百頁合規文件、學術論文、財報丟給 OCR,都需要切成小塊、處理完再拼接。Unlimited OCR 直接給出「一次吃完」的解法,這對律師事務所、會計師事務所、研究機構的數位化流程是結構性衝擊。
數據解讀與質疑
幾個關鍵數字值得放大檢視:
- 93.92% OmniDocBench v1.6:這個 benchmark 涵蓋公式、表格、版面理解等多維度,比傳統 OCR 評測嚴格得多。93.92% 代表它在「理解文件結構」這件事上已經接近人類專家水準。
- 比 DeepSeek-OCR 快 35%:這個數字是百度自己公佈的,獨立基準測試還沒出來。但因為 KV cache 是常數,理論上隨著文件變長,速度優勢只會更明顯。
- 3B 參數拿 SOTA:DeepSeek-OCR 也是 3B,但啟動參數是 570M;Unlimited OCR 是 500M。少了 70M 參數卻贏 6 個百分點,這個 trade-off 對學術界很有意思——它暗示「不是越大越好,架構設計比參數量重要」。
- 單次 32K tokens 解析數十頁:注意論文用詞是「dozens of pages」,不是「hundreds」。實際極限還是要看文件密度(純文字 vs 滿滿表格 vs 學術公式),可能落在 20-50 頁這個區間。
學術界也有保留態度。今年一月 arXiv 上發表的《Visual Merit or Linguistic Crutch? A Close Look at DeepSeek-OCR》(2601.03714)已經證明,end-to-end OCR 模型高度依賴 LLM 的語言先驗——把輸入文字的語意打亂,DeepSeek-OCR 的表現會從 90% 暴跌到 20%。Unlimited OCR 雖然改進了 attention,但本質上仍是 end-to-end 架構,這個弱點是否被克服,還需要獨立的 ablation study 來驗證。
資源與延伸閱讀
官方資源:
- GitHub: baidu/Unlimited-OCR — 程式碼與範例
- arXiv 2606.23050 — 技術報告全文
- Hugging Face: baidu/Unlimited-OCR — 模型權重
- ModelScope: PaddlePaddle/Unlimited-OCR — 中國鏡像
背景論文:
- DeepSeek-OCR: Contexts Optical Compression (arXiv 2510.18234) — Unlimited OCR 的 baseline
- Visual Merit or Linguistic Crutch? (arXiv 2601.03714) — 對 DeepSeek-OCR 的批評性檢驗
- PaddleOCR 開源倉庫 — 百度的 OCR 工業部署框架
網友熱門留言 (5)