十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

OCRmyPDF 多语言 OCR 快速上手指南

OCRmyPDF 多语言 OCR 快速上手指南 OCRmyPDF 多语言 OCR 快速上手指南【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF一份没有文字层的中文扫描 PDF 无法 CtrlF 搜索用 OCRmyPDF 加上-l chi_sim参数跑一遍后合同里的每一段话都能被检索和复制。本文带你完成从安装中文语言包到批量处理文件的完整链路让扫描件变成可搜索的 PDF。30秒速览用系统包管理器安装 Tesseract 中文简体语言包一条命令搞定用tesseract.get_languages()确认chi_sim已就位用ocrmypdf -l chi_sim给扫描 PDF 补上可搜索文字层按文档质量调整引擎模式、阈值处理等少数几个参数它是怎么工作的可以把 OCRmyPDF 理解成贴标签扫描件本身只是一张图片Tesseract 负责从图里读出文字OCRmyPDF 则把读出的文字按原始位置贴在图片下面生成一份带隐藏文字层的 PDF——肉眼看没变化但搜索框里已经能命中内容。语言的选择由-l参数决定它背后对应的是.traineddata训练数据文件装了什么语言包才能识别什么语言。动手配置第 1 步装 Tesseract 和语言包。OCRmyPDF 依赖 Tesseract ≥ 4.1.1见 docs/installation.md。Debian/Ubuntu 上一条命令安装中文简体包sudo apt-get install tesseract-ocr tesseract-ocr-chi-sim执行后你应该看到包列表滚动结束、末尾提示is already the newest version或Setting up tesseract-ocr-chi-sim。Fedora 用dnf install tesseract-langpack-chi_sim。第 2 步验证语言包可用。直接查引擎已加载的语言清单比翻目录更可靠from ocrmypdf._exec import tesseract print(tesseract.get_languages())执行后你应该看到输出列表中包含chi_sim没有的话说明包没装全回到第 1 步。第 3 步跑一次 OCR。对单份文件ocrmypdf -l chi_sim scan.pdf out.pdf执行后你应该看到进度条走完后用文本编辑器打开out.pdf能选中并搜索中文文字。参数与调优影响实际效果的主要是这几个完整参数解析逻辑见 src/ocrmypdf/builtin_plugins/tesseract_ocr.py参数作用建议取值--tesseract-oem识别引擎0 传统、1 LSTM 神经网络、3 自动1Tesseract 4--tesseract-pagesegmode页面布局假设共 14 种3 默认6 单栏文本11 插图多--tesseract-thresholding二值化方式otsu、adaptive-otsu、sauvola背景不均时adaptive-otsu需 Tesseract 5.0--user-words 词典.txt注入领域词表每行一词专业术语多的文档真实场景演练假设你有一个contracts/目录里面是十几份扫描版中文合同需要一次性变成可搜索cd contracts for f in *.pdf; do ocrmypdf -l chi_sim -o out_ $f done-o前缀会自动给输出文件加上out_前缀、避免覆盖原件。执行完你应该看到contracts/下出现同名的out_*.pdf任选一份用pdftotext out_合同.pdf - | head能看到提取出的中文正文而不是空白。踩坑与排错现象报language chi_sim not found→ 原因语言包没装上或代码写错注意是chi_sim不是zh/cn→ 用tesseract --list-langs核对已装语言缺了就按第 1 步补装。现象竖排日文识别结果错乱→ 原因默认按横排版面切分 → 换成竖排模型并指定版面模式ocrmypdf -l jpn_vert --tesseract-pagesegmode 5 in.pdf out.pdf现象超大扫描件直接报图像尺寸错误→ 原因Tesseract 单边上限 32767 像素 → 加下采样开关超过 3000 像素的图先缩小再识别ocrmypdf -l chi_sim --tesseract-downsample-large-images in.pdf out.pdf回到开头那份合同现在它已经能像普通 Word 文档一样被检索了。装好语言包、跑通第一条ocrmypdf -l chi_sim命令剩下的只是把命令搬进循环里的事。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表