
RapidOCR 古籍竖排文字识别实战指南从安装到调参一次讲清【免费下载链接】RapidOCR Awesome OCR multiple programing languages toolkits based on ONNX Runtime, OpenVINO, MNN, PaddlePaddle, TensorRT and PyTorch.项目地址: https://gitcode.com/GitHub_Trending/ra/RapidOCRRapidOCR 是一个完全开源免费的 OCR 文字识别库把 PaddleOCR 的深度学习模型转成 ONNX 等通用格式默认靠 onnxruntime 在 CPU 上离线推理特别适合古籍数字化、扫描件转文本这类不想依赖 GPU 和在线服务的场景。 古籍数字化 OCR 的四个高频痛点当你拿到从右往左竖排的古籍扫描件整列文字被通用 OCR 当噪声漏掉当你处理透明底、深底白字的图识别结果整行丢字当你要把识别结果回填到校对界面却只拿到整行文本没有每个字的坐标当你想在离线服务器、Windows 桌面、C/Java 项目里跑同一套模型不想为每台机器装不同依赖。 RapidOCR 一键安装步骤与版本要求最低要求 Python 3.8pyproject 声明 3.8,4两条命令装完pip install rapidocr onnxruntime首次调用会自动下载 PP-OCRv6 small 的检测与识别模型缓存在 python/rapidocr/models 目录之后全部走本地断网也能跑。装完执行rapidocr check它会跑一张测试图首行输出“正品促销”即代表模型和依赖都正常。 核心功能实战从整页识别到逐字坐标三段流水线一键跑通检测、分类、识别各管一段场景批量把扫描页转文本不想手写检测后处理。做法参照 demo.pyfrom rapidocr import RapidOCR engine RapidOCR() result engine(scan.png) result.vis(vis_result.jpg)实际效果检测找文字框、方向分类纠正 0°/180° 颠倒、识别出文本三段分别由 PP-OCRv6 small 检测模型、PP-OCRv4 mobile 分类模型、PP-OCRv6 small 识别模型完成全部在 CPU 上跑。仓库测试图 ch_en_num.jpg323x430走默认流水线出 18 行文本每行带置信度和四点坐标vis 一行生成标注图。竖排窄列文字为什么漏检vertical padding 怎么救场景古籍一列文字又细又长检测模型对极窄区域响应弱整列丢失。RapidOCR 在 config.yaml 里给了针对窄条的处理use_vertical_padding 默认 truemin_height: 30 跳过高度不足 30px 的碎块width_height_ratio: 8 对高宽比超过 8 的窄列左右补齐再送检测。实际效果仓库测试图 text_vertical_words.png 就是一页竖排开启逐字框后首列按序返回“已取之時不參一人見而”10 个字竖列没有漏。给每个字一个坐标return_word_box 校对用法场景透明底白字图或要把结果逐字回填校对 UI光有整行文本不够。调用时加一个参数engine(img.png, return_word_boxTrue)每个文本行都带上逐字坐标再加return_single_char_boxTrue可拆到单字。实际效果测试图 black_font_color_transparent.png透明底“我是中国人”按字返回 5 个带坐标的结果透明背景不影响识别。 进阶调优模型选择与检测参数怎么改模型三件套在 config.yaml 的 Det/Cls/Rec 三段ocr_version 选 PP-OCRv4/v5/v6model_type 选 tiny/small/mediumlang_type 选语言。default_models.yaml 的清单覆盖 16 种语言繁体古籍把 Rec.lang_type 设为 chinese_cht版式复杂的文档可换 ch_doc 文档识别模型日文书籍直接选 japan。阈值参数四个最常用Global.text_score 默认 0.5低于它的行被丢弃嫌漏结果就降到 0.3Det.box_thresh 默认 0.5调低如 0.4减少漏框但可能引入噪框Det.unclip_ratio 默认 1.6调大让检测框更宽适合字距紧凑的古籍Global.max_side_len 默认 2000超长的图等比缩小再推理高 DPI 原图不用白烧算力。引擎侧 engine_type 支持 onnxruntime、openvino、paddle、pytorch、tensorrt、mnn 六选一有 N 卡换成 tensorrt 并开 use_fp16: trueIntel CPU 换 openvino 通常更省内存。✅ 落地清单5 条可执行建议装完先跑rapidocr check确认模型下载和依赖没问题再开工高 DPI 扫描页统一控制在长边 2000px 以内再进推理精度损失可忽略、耗时明显下降竖排漏检多时优先把 box_thresh 从 0.5 调到 0.4 复测再考虑 unclip_ratio 加到 2.0繁体古籍固定Rec.lang_type: chinese_cht别用默认 ch 模型硬扛接校对流程时开启return_word_box: true逐字坐标直接驱动高亮和批注。跑通这三段流水线古籍转文本里最费人力的部分就能交给脚本剩下的难字交给人工校对。【免费下载链接】RapidOCR Awesome OCR multiple programing languages toolkits based on ONNX Runtime, OpenVINO, MNN, PaddlePaddle, TensorRT and PyTorch.项目地址: https://gitcode.com/GitHub_Trending/ra/RapidOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考