十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

3 条命令搞定 PDF 智能翻译:PDFMathTranslate 保留排版翻译完整指南

3 条命令搞定 PDF 智能翻译:PDFMathTranslate 保留排版翻译完整指南 3 条命令搞定 PDF 智能翻译:PDFMathTranslate 保留排版翻译完整指南【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate熬夜追综述,30 页英文论文读得磕磕绊绊?用 PDFMathTranslate 做一次 PDF 翻译,3 条命令就能在你自己的电脑上跑出一份公式完整、排版不动的中文论文,整个过程不超过 5 分钟。一句话讲清:它到底帮你做什么PDFMathTranslate 是一款开源的 PDF 文档智能翻译工具,专为学术论文和科技文档设计:它先用版面检测模型识别出公式、图表、目录这些不能动的区域,再只翻译文字部分,最后把译文贴回原 PDF 骨架里。和复制文字丢进在线翻译的做法不同,它的差异点在两处:排版保真:页眉页脚、页码、图表位置原封不动,你拿到的仍是一份像原版的 PDF,而不是一堆重排的文本。可自由切换翻译引擎:Google、DeepL、OpenAI 都支持,也能接 Ollama 跑本地模型,不想联网也能翻译。项目已被 EMNLP 2025 收录,核心实现在 pdf2zh/ 目录下。先对号入座:你的使用场景场景 A:手边一篇英文论文,要尽快读懂你会遇到的问题:直接整段复制粘贴到网页翻译,公式变成乱码,图表说明错位,读起来还是费劲。它怎么解决:一条命令丢进 PDF,几分钟后当前目录多出两个文件——纯中文版和双语对照版,公式、表格、目录全部保留。场景 B:不想碰命令行,想点鼠标搞定你会遇到的问题:装完工具后面对黑底白字的终端就发怵,希望拖个文件进去就能看到结果。它怎么解决:带一个pdf2zh -i,它会起一个本地网页服务,你在浏览器里上传 PDF、选翻译服务,点开始就行,界面长这样:场景 C:想装在服务器上,团队共用或批量跑你会遇到的问题:每人本机装一遍太折腾,还总有人卡在依赖安装;团队里需要一个人翻译好、大家都能访问。它怎么解决:用 Docker 一行拉取镜像、一行起容器,7860 端口暴露出来的就是上面那个网页界面,团队成员打开浏览器就能用,主机上不用装任何 Python 环境。三步跑起来:从 0 到第一份译文第 1 步:确认 Python 版本python --version看到 3.11 或 3.12 就可以继续;低于 3.11 或高于 3.13 都会装不上,先去装一个合适版本。第 2 步:安装pip install pdf2zh装完后在终端敲pdf2zh --version,能打印出版本号就说明工具已就位。第 3 步:翻译第一份文档pdf2zh example.pdf跑完之后,当前目录会多出两个新 PDF:example-mono.pdf(纯中文)和example-dual.pdf(中英双语对照),用 PDF 阅读器打开即可。常用参数速查表参数作用一个例子-s指定翻译服务(默认 google)pdf2zh 论文.pdf -s deepl-li/-lo指定源语言 / 目标语言pdf2zh 论文.pdf -li en -lo zh-p只翻译指定页,省时省钱pdf2zh 论文.pdf -p 1-5-t并发线程数,调大提速(默认 4)pdf2zh 论文.pdf -t 8-o指定输出目录,避免散落pdf2zh 论文.pdf -o result--ignore-cache忽略翻译缓存,强制重新翻译pdf2zh 论文.pdf --ignore-cache完整参数列表在 docs/ADVANCED.md 里都有解释,更多细节可翻 docs/。效果对比:翻译前后长什么样左边是原始英文论文,右边是翻译完成后的中文版:翻译前:典型的英文学术论文首页,公式、图表、参考文献都在各自的位置上。翻译后:同一份论文的中文版,版式与原版逐页对应,数学公式未被改写,图表位置分毫未动。5 个容易踩的坑Python 版本不对还硬装——pdf2zh 只支持 3.11 到 3.12,装之前先跑一遍python --version,版本不符就去装一个,别和安装报错较劲。首次运行卡在下载模型——它需要下载 DocLayout-YOLO 的 ONNX 版面模型,网络不顺时会一直转圈。配置代理或镜像源的说明见 docs/PROXY_CONFIGURATION.md。换了翻译服务却没配密钥——默认用 Google 无需配置;改用-s deepl、-s openai等需要先设置对应的 API key 环境变量,否则会直接报错。不想用密钥就选 Ollama,本地模型离线翻译。把扫描版 PDF 喂进去——它翻译的是 PDF 里的文字层;纯图片扫描件没有文字可提取,结果会残缺,这种文件先做 OCR 再翻译。找不到生成的译文——输出固定落在运行命令时所在的目录,命名规则是原文件名加-mono和-dual后缀;想让结果进指定文件夹,用-o参数指定。另外记住:公式和参考文献被刻意保留原文,这是设计行为,不是漏翻。第一次上手,建议就用默认参数翻译一篇 5 页左右的短文验证流程,再处理长文档。现在就可以把最想看的那篇英文论文丢进终端——3 条命令之后,带公式、保留排版的中文版本就躺在你的目录里了。【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表