Skip to main content

OCR AI

PDF Extractor

OCR

  • OCRFlux is a multimodal large language model based toolkit for converting PDFs and images into clean, readable, plain Markdown text.
  • Mistral OCR 3 - 雲端商用服務,可提取 PDF/Image 格式文件,手寫中文辨識不佳;中文印刷字體辨識沒問題。
  • Zerox OCR - 上傳檔案 ➜ 轉成圖片序列 ➜ 交給視覺模型分析 ➜ 輸出 Markdown ,支援 PDF/DOCX/Excel/PPT等格式,內建 JSON Schema 結構化輸出。  
  • MinerU — High-accuracy document parsing engine for LLM · RAG · Agent workflows
  • TaxHacker 是一款自架式會計應用程式,上傳收據、發票或 PDF 檔案的照片,TaxHacker 便會自動辨識並擷取您進行會計處理所需的所有重要資料。
  • Ollama OCR - 一個 Python 套件,透過 Ollama 在本地運行視覺語言模型,從圖像和 PDF 中提取文字。無需雲端。無需 API 金鑰。無使用限制。
dots.ocr

是一款強大的多語言文件解析器,能在單一視覺語言模型中整合版面檢測與內容識別功能,同時維持良好的閱讀順序。儘管其基礎模型僅採用精簡的 1.7B參數大型語言模型架構,仍能達到頂尖技術水準(SOTA)的表現。 

DeepSeek-OCR

只有3B參數,採用「光學上下文壓縮」技術,將文字視為圖像,利用視覺token進行壓縮和理解,把長文字轉換成圖像進行處理,極大地降低了計算資源消耗。

olmOCR

支持結構化精准提取復雜PDF文件內容!完美識別中英文文檔、模糊掃描件與復雜表格!本地部署與實際測試全過程!醫療法律行業必備!輕松應對企業級PDF批量轉換需求

Paddle OCR - 百度的開源文件解析模型 PaddleOCR-VL-1.5