百度開源 Unlimited-OCR:25K 星單次解析數十頁
2026-09-11 技術
Unlimited-OCR 是百度 2026 年 6 月發布的開源文件解析模型,GitHub 星標達 25,425。它以自研 R-SWA 注意力機制讓 KV 快取維持恆定,可在 32K 上下文內單次前向傳遞轉錄數十頁文件,並相容 vLLM 與 SGLang 部署。本文解析其架構創新、效能表現與適用場景。
閱讀更多以下是帶有「OCR」標籤的全部文章,共 8 篇。
2026-09-11 技術
Unlimited-OCR 是百度 2026 年 6 月發布的開源文件解析模型,GitHub 星標達 25,425。它以自研 R-SWA 注意力機制讓 KV 快取維持恆定,可在 32K 上下文內單次前向傳遞轉錄數十頁文件,並相容 vLLM 與 SGLang 部署。本文解析其架構創新、效能表現與適用場景。
閱讀更多
2026-09-11 技術
Umi-OCR 是免費開源的離線 OCR 軟體,於 GitHub 累積 47,220 星標,支援截圖識別、批量識別、PDF 掃描件轉雙層可搜索 PDF、二維碼與公式識別,內建 Paddle-OCR 與 Rapid-OCR 引擎,免安裝解壓即用。本文解析其核心功能、排版解析技術與應用場景。
閱讀更多
2026-09-10 技術
Docling 是 IBM 發起、現由 LF AI & Data 基金會託管的開源文件解析工具,GitHub 星標達 66,197,可將 PDF、DOCX、PPTX、試算表與掃描文件轉換為生成式 AI 可直接讀取的結構化格式。本文解析其技術架構、VLM 支援、MCP 整合與市場定位。
閱讀更多
2026-09-09 技術
Tesseract 是擁有 76,350 星標的開源 OCR 引擎,源於 1985 年 HP 實驗室,2005 年開源、2006 至 2017 年由 Google 維護,最新穩定版 5.5.3 於 2026 年 7 月發佈。本文分析其 LSTM 核心架構、逾百種語言支援與整體生態定位。
閱讀更多
2026-09-02 技術
MinerU 是由 OpenDataLab 開發的高精度文檔解析引擎,將 PDF、DOCX、PPTX、XLSX 與圖片轉換為 LLM 可用的 Markdown 與 JSON,GitHub 獲 7.9 萬星標。本文分析其架構、109 種語言 OCR、MCP Server 整合與應用場景。
閱讀更多
2026-08-16 技術
Stirling-PDF 是 GitHub 星標逾 8.9 萬的開源 PDF 處理平台,以 Java 開發,提供 50 多種 PDF 工具,涵蓋合併、分割、簽署、遮罩、轉換與 OCR 等功能,支援桌面端、瀏覽器與自托管伺服器部署方式,文件不需上傳第三方服務,Docker 下載量逾 2,000 萬次。
閱讀更多
2026-08-15 技術
MinerU 是 GitHub 星標逾 7.7 萬的開源高精度文檔解析引擎,由 OpenDataLab 開發,可將 PDF、DOCX、PPTX、XLSX 與圖片轉化為 LLM 可直接讀取的 Markdown 與 JSON,支援 109 種語言 OCR,最新 3.4 版本將 OCR 準確度提升約 11%。
閱讀更多
2026-08-08 技術
PaddleOCR 是百度開源領先 OCR 與文檔解析引擎,GitHub 星標逾 87,000 顆,可將 PDF 與圖片轉換為 LLM 可讀的 Markdown 與 JSON 結構化數據,支援 100 種以上語言。PP-OCRv6 以單一模型覆蓋 50 種語言,PaddleOCR-VL-1.6 達 96.3% 準確率。
閱讀更多