MonkeyOCR:小参数多模态文档解析模型
MonkeyOCR 是基于轻量多模态大模型的开源文档解析工具,按结构、识别、关系三步解析 PDF,可还原公式、表格与阅读顺序,输出 Markdown,支持本地 GPU 推理。
项目资料
GitHub Ecosystem- 许可证
- Apache-2.0
- 主语言
- Python
- 星标
- 6,652
- 核查时间
- 2026-09-25
以上快照资料以核查当日为准,可能随版本或运营策略变化。
解析复杂版面 PDF,模块化 OCR 链条繁琐,通用多模态大模型效率又不高。MonkeyOCR 是基于轻量多模态大模型的文档解析模型,论文已被《中国科学:信息科学》接收。它按「结构—识别—关系」三步解析 PDF 或图片,生成 Markdown、版面标注 PDF 和块级 JSON。GitHubDaily 在 2025 年 6 月推荐过它;仅就 OmniDocBench 而言,README 称其中英文成绩超过 Gemini 2.5 Pro、GPT-4o 等更大模型。
核心功能
- SRR 三元范式:版面检测、内容识别、顺序预测三步走,替代多工具流水线。
- 双规格模型:pro-3B 与更轻的 pro-1.2B,README 称后者速度快约 36%、性能差距约 1.6%。
- 中英文档:评测覆盖论文、财报、试卷、杂志等九类页面。
- 本地部署:Gradio、FastAPI、Docker、AWQ 量化,本地 GPU 推理,无外部 API 依赖。
典型使用场景
- 含大量公式的论文、教材 PDF 批量转成 Markdown。
- 财报、报纸等多栏版面的结构化提取与阅读顺序还原。
- 把解析服务化,批量产出 RAG 语料。
快速上手
- 环境安装见
docs/install_cuda_pp.md; - 下载权重并解析:
python tools/download_model.py -n MonkeyOCR-pro-3B
python parse.py input_path
小结
适合要在本地解析中英文 PDF 的开发者、科研与数据团队,尤其适合 RAG 备料。注意:源码采用 Apache 2.0,但 v1 权重仅用于学术研究与非商业评估,商用需书面授权;推理需 NVIDIA GPU,部分显卡 Docker 镜像需修补;拍照、手写、繁体与多语种支持尚不完整;2026 年 7 月另有 v2,本仓库为 v1 主线、仍在维护。整体看,它是一套可控、可本地部署的文档解析方案。