精选项目#开源

BabelDOC:PDF 论文双语对照翻译库

把英文 PDF 论文解析重排后生成双语对照文档的开源翻译库,借助大模型翻译,尽量保留公式、表格等原有版式,可作 CLI 使用也能嵌入其他程序。

项目资料

GitHub Ecosystem
仓库地址github.com/funstory-ai/BabelDOC
许可证
AGPL-3.0
主语言
Python
星标
9,604
核查时间
2026-09-25

以上快照资料以核查当日为准,可能随版本或运营策略变化。

读外文学术论文时,很多人要在翻译软件和原文献之间来回切换,费时又打断思路。BabelDOC 是 funstory-ai 开源的 PDF 论文翻译库:把文档拆成文本块、图表等结构,交给大语言模型翻译,再按原版式渲染出双语对照 PDF,也能产出纯译文版。GitHubDaily 在 2025 年 4 月推荐过它。

核心功能

  • 双语对照:译文与原文并排或正反页交替,也可只输出纯译文,两种形式按需开关。
  • 版式还原:解析与渲染分两阶段,提供公式字体识别、图表区域保护等选项,尽量贴近原排版。
  • 大模型翻译:走 OpenAI 兼容接口调用 LLM,默认 gpt-4o-mini,官方推荐 glm-4-flash、deepseek-chat 等兼容性好的模型,也可经 litellm 接入更多模型。
  • 术语表:默认自动抽取术语,也支持载入 CSV 术语表,让关键名词的译法全文一致。
  • 扫描件与离线部署:内置 OCR 变通方案应对白底黑字扫描件;模型与字体可打包成离线资产,经 SHA3-256 校验后供内网使用。

典型使用场景

  • 阅读英文文献时生成对照 PDF,边看原文边看译文,不用在多个窗口间跳转。
  • 作为翻译引擎嵌入其他程序:PDFMathTranslate-next 已接入并提供自部署 WebUI,Zotero 有现成插件;官方建议 Python 侧经 pdf2zh next 调用。
  • 批量处理:支持多文件与指定页码范围,超长文档可自动拆分再合并,参数也能写进 TOML 配置固化下来。

快速上手

需要 Python 3.12 与 uv,翻译经 OpenAI 兼容接口完成:

uv tool install --python 3.12 BabelDOC
babeldoc --openai --openai-model "gpt-4o-mini" --openai-base-url "https://api.openai.com/v1" --openai-api-key "你的密钥" --files example.pdf

首次运行需下载模型与字体资产,也可预先打包成离线资产包分发给内网机器。

小结

适合常读英文论文的研究者和学生,也适合想把 PDF 翻译能力接入自家产品的开发者。注意:项目采用 AGPL-3.0 协议,商用前需评估传染性条款;翻译依赖 OpenAI 兼容服务;官方声明 CLI 主要用于调试,不为直接使用的终端用户提供技术支持,Python API 均按内部 API 对待;主要按英译中优化,表格翻译仍是实验性功能,默认输出带水印(可关闭)。整体功能覆盖比较完整,项目维护活跃,但复杂排版或非中英语对建议先试译几页再批量使用。