
OCRmyPDF 性能优化完整指南3 个开关让扫描 PDF 处理快 3 倍【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDFOCRmyPDF 是一款给扫描版 PDF 添加可搜索文字层的 OCR 工具很多人觉得它变慢了其实只是没开对开关。这篇指南带你把 OCRmyPDF 性能拉到最快先给你一张配置速查表再按清单拨对 3 个关键参数最后按场景单独调。读完你能直接复制命令让同一份文件从十几分钟缩到几分钟。一张表定档位先按你的电脑对号入座硬件档位典型配置推荐并发--concurrency优化级别--optimize输出格式适合谁低配2 核 CPU / 4GB 内存--concurrency 11--output-type pdf老笔记本、树莓派类设备中配4–8 核 / 8–16GB--concurrency 4或默认值1--output-type auto主力办公电脑高配8 核以上 / 32GB用默认值自动取核心数一半1–2--output-type auto批量处理、服务器部署先记住这张表后面所有参数都是围绕并发数、优化级别、输出格式三根轴在动。第一块先把 3 个关键开关拨对 ⚡这三项立竿见影顺序照做即可--optimize 0求最快时关掉输出后的图片压缩优化。这是新版 OCRmyPDF 默认开启的后处理步骤也是官方说明里新版比 6.x 慢的主因只求速度就设 0追求小体积才用 1。--output-type pdf跳过 PDF/A 归档格式转换少一道 Ghostscript 转换工序速度最快、文件也更小。--mode skip只处理纯扫描页已有文字的页面直接原样拷贝不再光栅化和识别混排文档提速非常明显。完整命令长这样ocrmypdf --optimize 0 --output-type pdf --mode skip input.pdf output.pdf官方对速度的说明就写在 docs/performance.md 里核心思路与上面一致。第二块按你的配置对号入座选参数低配档ocrmypdf --concurrency 1 --optimize 0 --output-type pdf in.pdf out.pdf。单核跑 OCR 最稳并发开高反而抢内存。适合文件不大、只求别卡死的场景。中配档ocrmypdf --concurrency 4 --optimize 1 --output-type auto in.pdf out.pdf。保留默认的轻量优化和自动 PDF/A速度和质量平衡。适合每天要归档发票、合同的人。高配档直接省略--concurrency默认取核心数的一半--optimize 1起步大文档可加--optimize 2换更小体积。适合批量跑几十上百份文件的流程。补充两个进阶项个别页面图特别大时加--skip-big跳过超大图片需要控制体积时可加--jpeg-quality 85左右不必动更底层参数。第三块给不同用法单独调批量扫描处理追求吞吐--concurrency用默认值 --mode skip--optimize 0配合 misc/batch.py 脚本逐文件处理是吞吐最高的一套组合。档案归档追求规范与兼容保留默认--output-type auto和--optimize 1牺牲一点速度换取 PDF/A-2b 归档格式适合要长期保存的文档。质量优先追求识别准确率加--oversample 150对 150DPI 以上图片额外提升采样率--deskew速度会降但倾斜、低清扫描件的文字层明显更准。调了没效果按这个顺序查 第 1 步看 CPU 是否跑满。跑任务时开一个终端执行top。多核机器上 CPU 利用率只有两三成说明并发没生效检查是否被外部限流或容器核数限制。第 2 步确认没被--mode force拖慢。force会把整份文件所有页包括本来有文字的页全部光栅化再识别是典型的看起来在跑但很浪费的选项没这个必要就改用默认或skip。第 3 步用时间定位瓶颈。给任务计时若慢只集中在某几页多半是超大图片加--skip-big或降低扫描分辨率即可。第 4 步查磁盘空间。--clean、--clean-final等预处理会生成大量中间临时文件临时目录快写满时速度骤降先把TMPDIR指到空间充足的盘上再试。第 5 步对比官方默认值。逐项去掉自己的参数重跑一遍如果默认反而快说明某个调优项在你的文件类型上是负优化留痕回滚即可。收尾把这次优化变成你的默认工作流 建一个基准文件挑一份你经常处理的代表性 PDF把默认参数下的耗时记下来以后每次改配置都和它对比。把验证过的命令存成脚本或 shell 函数可参考 misc/ 里的批处理示例别每次现敲。升级 OCRmyPDF 版本后重测基准——官方 docs/performance.md 提到不同版本的默认行为会变重跑一次基准比凭感觉判断更可靠。性能调优不是一次性的事记住并发、优化级别、输出格式这三根轴任何新任务来了先查第一张表定档再按场景微调就能一直把 OCRmyPDF 的速度压到最合理的位置。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考