
OCRmyPDF 快速上手给扫描 PDF 加上可搜索的文本层【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDFOCRmyPDF 是一个命令行工具给扫描版 PDF 添加 OCR 文本层让原本只能看图的文件变得可搜索、可复制、可归档。适合经常处理扫描件、旧报纸影印件、手机拍文档的办公和归档用户。什么时候用得上老扫描件无法复制文字扫描出来的 PDF 只有一张图选中文字会失败你只能手动重打一遍。混合文档里有图有文PDF 里既有可复制的页、也有纯扫描页需要给缺文本的页单独补一层。批量归档历史文件几百页的影印件要长期保存还希望搜索关键词能直接定位到页。安装按你的系统选一条命令apt install ocrmypdf # Debian / Ubuntu / WSL dnf install ocrmypdf tesseract-osd # Fedora brew install ocrmypdf # macOS 及 Linux (Homebrew)包管理器会自动装好 Tesseract 等依赖Windows 没有单行命令可走 WSL或参考 docs/installation.md 的 pip 方式。第一条能跑通的命令ocrmypdf --deskew input.pdf output.pdf # 校正倾斜并加文本层运行完打开 output.pdf图片还在原位按住 Ctrl 就能选中、搜索、复制文字了。输入和输出可以是同一个文件名处理成功才会覆盖详见 docs/advanced.md。常用选项速查选项作用什么时候用-l eng指定识别语言支持多语言组合如engfra文档不是英文时--rotate-pages自动判断页面方向并转正横竖页混排、方向拍错的扫描件--deskew校正页面倾斜扫描或拍照歪斜时--sidecar out.txt同时导出一份纯文本要做全文检索或数据分析时-O 0-O 3压缩强度数字越大文件越小归档想省空间时用-O 3默认 1 即可组合用法手机拍的文档常见方向错加倾斜一次处理两件事ocrmypdf --deskew --rotate-pages scan.pdf out.pdf扫描旧文档时先去除背景杂色再连同纯文本一起输出ocrmypdf --remove-background --sidecar out.txt old.pdf out.pdf 容易踩的坑Q识别出来的字不对或是一堆乱码A多半是语言包没装对或-l没指定见 docs/languages.md。另外 Tesseract 不认识手写体扫描质量差结果也会差。Q输出文件为什么比原文件大A默认输出 PDF/A 归档格式会把字体等资源全部嵌入。只要普通 PDF 就加--output-type pdf。Q--clean和--clean-final有什么区别A--clean只影响 OCR 过程不改输出图像--clean-final会把清理后的图写进结果使用前要逐页确认没误删内容。深入资源docs/cookbook.md图片转 PDF、多语言等更多用法docs/optimizer.md--optimize各等级的说明docs/errors.md报错信息对照与处理办法misc/watcher.py文件监听批处理的示例脚本装好以后拿第 4 节那条命令跑一个你自己的扫描件看看文本层是不是真的能选中。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考