精选项目#开源

MonkeyOCR:小参数多模态文档解析模型

MonkeyOCR 是基于轻量多模态大模型的开源文档解析工具,按结构、识别、关系三步解析 PDF,可还原公式、表格与阅读顺序,输出 Markdown,支持本地 GPU 推理。

项目资料

GitHub Ecosystem
仓库地址github.com/Yuliang-Liu/MonkeyOCR
许可证
Apache-2.0
主语言
Python
星标
6,652
核查时间
2026-09-25

以上快照资料以核查当日为准,可能随版本或运营策略变化。

解析复杂版面 PDF,模块化 OCR 链条繁琐,通用多模态大模型效率又不高。MonkeyOCR 是基于轻量多模态大模型的文档解析模型,论文已被《中国科学:信息科学》接收。它按「结构—识别—关系」三步解析 PDF 或图片,生成 Markdown、版面标注 PDF 和块级 JSON。GitHubDaily 在 2025 年 6 月推荐过它;仅就 OmniDocBench 而言,README 称其中英文成绩超过 Gemini 2.5 Pro、GPT-4o 等更大模型。

核心功能

  • SRR 三元范式:版面检测、内容识别、顺序预测三步走,替代多工具流水线。
  • 双规格模型:pro-3B 与更轻的 pro-1.2B,README 称后者速度快约 36%、性能差距约 1.6%。
  • 中英文档:评测覆盖论文、财报、试卷、杂志等九类页面。
  • 本地部署:Gradio、FastAPI、Docker、AWQ 量化,本地 GPU 推理,无外部 API 依赖。

典型使用场景

  • 含大量公式的论文、教材 PDF 批量转成 Markdown。
  • 财报、报纸等多栏版面的结构化提取与阅读顺序还原。
  • 把解析服务化,批量产出 RAG 语料。

快速上手

  1. 环境安装见 docs/install_cuda_pp.md;
  2. 下载权重并解析:
python tools/download_model.py -n MonkeyOCR-pro-3B
python parse.py input_path

小结

适合要在本地解析中英文 PDF 的开发者、科研与数据团队,尤其适合 RAG 备料。注意:源码采用 Apache 2.0,但 v1 权重仅用于学术研究与非商业评估,商用需书面授权;推理需 NVIDIA GPU,部分显卡 Docker 镜像需修补;拍照、手写、繁体与多语种支持尚不完整;2026 年 7 月另有 v2,本仓库为 v1 主线、仍在维护。整体看,它是一套可控、可本地部署的文档解析方案。