
RapidOCR 入门指南多语言 OCR 一条命令跑起来【免费下载链接】RapidOCR Awesome OCR multiple programing languages toolkits based on ONNX Runtime, OpenVINO, MNN, PaddlePaddle, TensorRT and PyTorch.项目地址: https://gitcode.com/GitHub_Trending/ra/RapidOCR拿到一张带文字的图片想快速把文字提取出来RapidOCR 是一个免费开源的多语言文本识别工具底层把 PaddleOCR 模型转成 ONNX 通用格式支持 OnnxRuntime、OpenVINO、PaddlePaddle、TensorRT 等多种推理引擎Windows、Linux、macOS 都能离线运行。这篇指南带你从安装到跑通再到看懂代码结构。先认清它输入图片输出文字RapidOCR 干的事一句话能说清给一张图片还你文字内容、每段文字的坐标和置信度。默认模型支持中英文换成对应语言模型后还能识别日语、韩语、阿拉伯语等仓库测试集里就有这些语言的样例图。它内部分三步走检测模型找出文字区域方向分类模型判断文字是否倒置识别模型把字读出来。装好之后先跑最小示例。 三步完成安装最省事的方式是直接装 PyPI 上的包pip install rapidocr onnxruntime不用配 GPU也不用手动下模型首次识别时模型会自动下载并缓存在本地。如果你有 NPU、Apple 芯片或者想用 TensorRTdocker/ 目录下每种推理引擎都配了现成的 Dockerfile直接构建即可。下一步写五行代码识别第一张图。五行代码识别第一张图from rapidocr import RapidOCR engine RapidOCR() result engine(your_image.jpg) print(result) result.vis(vis_result.jpg)result是结构化对象result.txts是识别出的文字result.scores是置信度result.boxes是坐标。result.vis()会把识别框画回原图并保存方便你肉眼确认它认没认对。想直接看完整流程python/demo.py 是官方示例原样可运行。跑通之后再按需换语言、换引擎。⚙️ 切换语言与推理引擎两个最常用的进阶操作换语言初始化时传 params 字典覆盖配置里的lang_type字段即可切换识别模型的语言engine RapidOCR(params{Rec: {lang_type: en}})换引擎修改 python/rapidocr/config.yaml 中 Det、Cls、Rec 三个段落下的engine_type从 onnxruntime 换成 paddle、openvino 或 tensorrt业务代码一行不用动。再附两个小开关把return_word_box设为 true 可以拿到词级别坐标方向分类阶段会自动处理倒置文字横竖混排也能正常读出。接下来看看这些能力对应代码里的哪些目录。 从目录结构看它如何工作核心就是三个目录加一个配置文件python/rapidocr/ch_ppocr_det/文本检测负责定位图片里的文字区域python/rapidocr/ch_ppocr_rec/文本识别负责读出文字内容python/rapidocr/inference_engine/六种推理引擎各占一个子目录扩展或对比引擎都在这里所有模型选择和引擎参数集中在 config.yaml 里改行为不用翻代码。调优建议与适用场景调优记住三点图片过大过小会自动缩放文字清晰比盲目放大更有效纯 CPU 环境保持默认 onnxruntime有 NVIDIA 显卡建议切 tensorrt出现漏字或误框时优先调配置里的text_score阈值。它适合这几类场景纸质文档数字化一条命令把扫描件变成可编辑文本网页截图信息提取给翻译工具提供文字输入以及用 MNN 引擎部署到手机等边缘设备。现在就执行一条pip install rapidocr onnxruntime拿你手头任何一张带字的图片跑起来。【免费下载链接】RapidOCR Awesome OCR multiple programing languages toolkits based on ONNX Runtime, OpenVINO, MNN, PaddlePaddle, TensorRT and PyTorch.项目地址: https://gitcode.com/GitHub_Trending/ra/RapidOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考