免费把英文PDF变成中英对照版:BabelDOC 快速上手指南
【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC
BabelDOC 是一个开源的 PDF 翻译工具:你丢一份英文论文进去,它输出原文和译文左右并排的中英对照 PDF,公式、字号和版面尽量保留,翻译走任意 OpenAI 兼容接口。
40页论文两周读完?先看看你常走的三条弯路
导师丢来一篇 40 页的英文论文,两周要交综述。你大概率会试这三招:选中复制丢给网页翻译,上下标和公式全碎;整页截图走 OCR,双栏论文的阅读顺序经常反,参考文献被并成一坨;先转 Word 再翻,版面直接崩掉,图表全飘。问题不在语言能力,在 PDF 本身就是"印出来"的文本——你需要的是能读懂版面结构、只翻译文字、再按原样式重新排版的工具。
一条命令装好并跑通 BabelDOC
推荐用 uv 安装,一行搞定,首次运行会自动下载字体和版面分析模型:
uv tool install --python 3.12 BabelDOC装完备一个 OpenAI 兼容的 key(官方接口、DeepSeek、Ollama 本地模型都行),最小可跑命令长这样,路径建议用绝对路径:
babeldoc --files /path/to/paper.pdf \ --openai --openai-model "gpt-4o-mini" \ --openai-base-url "https://api.openai.com/v1" \ --openai-api-key "你的key"进度条跑完、命令正常退出就算成功。要改源码或跟最新提交:git clone https://gitcode.com/GitHub_Trending/ba/BabelDOC进目录后uv run babeldoc --help即可。
首次运行会产出哪两个 PDF 📦
文件落在当前目录(或--output指定的目录):
- 双语 PDF:原页和译页左右并排,这就是你要的中英对照版本;
- 单语 PDF:纯译文,只读译文时不用左右分屏。
整个流程:丢进英文 PDF → 解析、翻译、重排版 → 得到对照 PDF,中间不用你干预。
BabelDOC 怎么做到不崩版面
它内部是一条管线:先用内置解析器把页面切成段落、公式、表格区域(解析管线在 babeldoc/format/pdf/document_il/),大模型只翻译纯文本,公式符号原样保留,最后按原文的字体字号重排成对照页。对你来说这意味着:
- 输出还是 PDF,能直接存档、打印;
- 原文译文并排,对照着读不用来回翻页;
- gpt-4o-mini 这类便宜模型就够用,40 页论文的 API 花费可控。
高频 BabelDOC 参数速查
| 参数 | 作用 |
|---|---|
--pages "1,3,5-8" | 只翻指定页,先试读、控制费用 |
--files a.pdf --files b.pdf | 一次批量处理多个 PDF |
--lang-in/--lang-out | 源/目标语言,默认en→zh |
--no-dual/--no-mono | 只出两种文档之一,省一半生成时间 |
--max-pages-per-part | 长文档按页拆分翻译,完成后自动合并 |
--qps | 每秒请求数上限,默认 4,限额紧就调低 |
--output | 指定输出目录,默认当前目录 |
--glossary-files是被低估的参数:传一份三列source,target,tgt_lng的 CSV,示例见 docs/example/demo_glossary.csv,命中的术语会被强制塞进提示词,专名译法就稳定了。--max-pages-per-part也值得记一下:文档一长就分批翻再合并,中途失败只重跑那一批。
实际用前绕开这几个坑 ⚠️
- 扫描件译文盖住原文互相叠字:检测会漏判,白底黑字的扫描件加
--ocr-workaround,会在译文下垫白色底块并强制文字黑色。 - 输出 PDF 在某些阅读器打不开:先试
--enhance-compatibility,它等价于--skip-clean --dual-translate-first --disable-rich-text-translate的组合;注意跳过 clean 的代价是文件变大。 - 长文档中途失败:翻译有缓存,重跑不会重复消耗 API;但
--ignore-cache是强制重翻,别习惯性带上。 - 本地模型别忘改 key:Ollama 这类服务不校验,随便填个
a就能过。 - 作者区和参考文献可能被并成一段:官方承认的已知问题(另有不支持横线、首字下沉等限制),个别段落粘连别怀疑自己操作错了。
- 非英中语言对先用
--pages抽几页试:项目主要打磨英文→中文,其他方向未经充分测试。
命令行之外还能做什么
- 想看每个阶段怎么实现的,docs/ImplementationDetails/ 里解析、找段落、样式与公式、排版各有专篇;
- 想嵌进自己的 Zotero 工作流或批量文献脚本,它提供 Python API(官方视为内部接口,嵌入时注意钉住版本);
- 要 Web 界面或更多翻译服务,社区有自部署项目 PDFMathTranslate-next;无外网环境用
--generate-offline-assets打一个离线资产包分发即可。
备齐一个 API key,跑一条命令,半小时后你就拿到一份可以左右对照阅读的中英双语 PDF。对论文翻译这个高频场景,BabelDOC 目前是开源方案里把"版面不崩"做得最省心的那一个。
【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考