
PP-OCRv6 深度拆解三档 OCR 模型族与 50 种语言识别实战【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR一个 34.5M 参数的 OCR 模型在 16 类场景文本检测基准上拿到 86.2% Hmean而 235B 参数的 VLM 只有 38.3%。这是 PaddleOCR 最新一代 PP-OCRv6 的 medium 档成绩——它基于全新的 PPLCNetV4 统一骨干以 tiny/small/medium 三档覆盖端侧到服务端并用单模型统一支持中、英、日加 46 种拉丁语系共 50 种语言。读完本文你能带走三样东西三档模型的选型依据、统一骨干的设计原理、以及一条 6 行代码就能跑通的端到端识别路径。三档模型族速览关键指标一览PP-OCRv6 不是单一模型而是一个三档模型族官方口径覆盖 1.5M–34.5M 参数全部基于同一套骨干与检测/识别架构。核心数据如下档位参数量目标场景语言数检测 Hmean识别准确率tiny约 1.1M端侧 / IoT49不含日文80.6%73.5%small中间档官方未公布具体值移动端 / 桌面端5084.1%81.3%medium34.5M服务端5086.2%83.2%说明精度数据来自官方内部多场景综合评估集检测 16 类场景、识别 15 类场景VLM 对照为发布时点版本具体数值会随基准演进而变化。这意味着什么medium 档相比上一代 PP-OCRv5_server识别准确率提升 5.1 个百分点83.2% vs 78.1%、检测提升 4.6 个百分点86.2% vs 81.6%同时 A100 上 GPU 推理速度快 2.37×0.29s vs 0.32s。如果你的业务是工业部署或大规模文档数据管线medium 是官方定位的生产级档位而 tiny 档仅 1.1M 参数官方称其已超越对照表中 4/5 的 VLM适合端侧/IoT 的延迟敏感场景。PPLCNetV4 统一骨干一个骨干如何同时服务两个任务Block 结构MetaFormer 范式加结构重参数化它替代了什么PP-OCRv5 时代服务端ResNet 系与移动端MobileNet/LCNet 系各有独立骨干且检测与识别各用一套。PPLCNetV4 用一个骨干族把两件事都统一了。它怎么做的每个 Block 按 MetaFormer 范式解耦为 Token Mixer3×3 深度卷积负责空间混合与 Channel Mixer2 倍扩展全连接负责通道重加权x̂ SE(DW(x)) x y W₂·σ(W₁·x̂) x̂白话翻译先做空间混合相邻像素互相交流SE 给通道加权再用 2 倍扩展的 MLP 做通道交互每步都带残差。源码 rec_lcnetv4.py 中NET_CONFIG_DET/NET_CONFIG_REC两组配置定义了 tiny/small/medium 三档宽度检测模式 medium 档通道演进为128 → 256 → 512 → 896。带来了什么收益三档规模共用一套架构与训练管线medium 档以 34.5M 参数取得上表成绩且相比 v5_server 推理快 2.37×0.29s vs 0.32s。任务自适应下采样同一网络两种切法检测模式标准 stride-2 下采样产出 stride 4/8/16/32 的多尺度特征图供 FPN 聚合识别模式Stage 3/4 改为非对称 stride (2,1)只压高度、保留宽度再经高度轴平均池化输出 1-D 序列给 CTC 解码。设计取舍一目了然检测要的是多分辨率金字塔识别要的是保住横向顺序的一条串。同一骨干按任务切换切法这就是一骨干两任务的全部秘密。检测侧RepLKFPN 大核轻量金字塔替代了PP-OCRv5 的 RSEFPN3×3 普通卷积。DilatedReparamBlock用 7×7 深度卷积 膨胀分支换更大的感受野参数从 172K 降到 118K−31%感受野从 3×3 扩到 7×7。实现见 db_fpn.py 的RepLKFPN类约 L307 起部署前调用rep()即可把训练期的多分支合并成单一大核卷积推理零额外开销。配合 P2/P3/P4 三层辅助预测头的深度监督训练时梯度更强推理时这些辅助头直接移除。识别侧EncoderWithLightSVTR 颈部替代了PP-OCRv5 的拼接式concatenation上下文建模。它由 1×7 深度卷积做局部上下文 1–2 层 Transformer 做全局自注意力跳跃连接用加法代替拼接参数显著减少注册于 rnn.py 的lightsvtr分支EncoderWithLightSVTR约 L242 起。解码采用多头设计CTCHead 负责训练与推理NRTRHead 仅作训练期辅助监督推理时移除。管线拆解从图像输入到文本输出① 输入与预处理端到端管线提供三个可选模块——文档方向分类、文档矫正、文本行方向分类对应 API 中的三个开关。纯文字图片建议全部关闭跳过预处理直走检测→识别主链路处理倾斜扫描件则保持开启。设计取舍关掉省算力开启换对倾斜/旋转输入的鲁棒性。② 文本检测功能是把整图切出文本区域多边形。PPLCNetV4det 模式→ RepLKPAN 颈部 → DBHeadk50输出概率图DBPostProcessthresh 0.2、box_thresh 0.45、unclip_ratio 1.4还原文本框。关键配置见 PP-OCRv6_medium_det.ymlArchitecture: algorithm: DB Backbone: { name: PPLCNetV4, det: true, model_size: medium } Neck: { name: RepLKPAN, out_channels: 256, intracl: true } Loss: name: DBLoss main_loss_type: DiceFocalLoss aux_weight_p4: 0.2训练侧DiceFocalLoss组合 Dice 与 Focal 两类损失对小目标和密集文本做逐像素监督P2/P3/P4 辅助头按aux_weight0.4/0.3/0.2加权优化器 Adam Cosine初始 0.001warmup 2 epoch增强链含 CopyPaste、ColorJitter、RandomPerspective、RandomCrop输入尺寸 640×640EMA 衰减 0.9996共 500 epoch。取舍640×640 的固定训练尺寸换小目标召回代价是大图上需依赖 unclip 外扩补偿。③ 文本识别功能是把每个文本区域裁剪后转成文字串。PPLCNetV4rec 模式非对称下采样→ LightSVTR 颈部 → 多头解码。关键配置见 PP-OCRv6_medium_rec.ymlalgorithm: SVTR_LCNet Backbone: { name: PPLCNetV4, model_size: medium } Head: name: MultiHead head_list: - CTCHead: { Neck: { name: lightsvtr, dims: 192, depth: 2, local_kernel: 7 } } - NRTRHead: { nrtr_dim: 512, max_text_length: 25 }local_kernel: 7对应 1×7 深度卷积的局部建模depth: 2为 2 层全局注意力max_text_length: 25限制最大文本长度。多语言靠字典扩展实现medium/small 用 ppocrv6_dict.txt18,708 字符含约 200 个带变音符号字符tiny 用 ppocrv6_tiny_dict.txt6,904 字符。训练采用 MultiScaleSampler 三尺度高度 32/48/64宽度 320 RecConAug 融合增强Adam Cosine0.0005warmup 5 epoch共 100 epoch。取舍多尺度训练提升不同字号下的鲁棒性代价是训练吞吐下降。④ 输出predict()返回逐图结果对象print()查看、save_to_json()/save_to_img()落盘管线组装逻辑在 paddleocr/_pipelines/模块与管线的注册机制在 paddleocr/_models/ 与 paddleocr/_doc2md/ 中可进一步定制。实测精度与推理速度对比检测精度官方内部 16 类场景基准Hmean%完整 16 场景表见 PP-OCRv6.md模型AVG日文古籍旋转工业通用PP-OCRv6_medium86.284.380.293.873.382.8PP-OCRv6_small84.182.372.693.767.678.2PP-OCRv6_tiny80.676.663.091.062.073.8PP-OCRv5_server81.677.267.680.064.379.7GPT-5.545.642.026.710.036.232.6Qwen3-VL-235B38.327.013.12.148.432.3差距在长尾不在主流印刷体等常规场景各代模型都接近 95%真正拉开差距的是日文84.3 vs v5_server 77.2、古籍80.2 vs 67.6、旋转文本93.8 vs 80.0与工业字符73.3 vs 64.3。反直觉的一点VLM 的强项恰恰是它的短板——GPT-5.5 在旋转场景只有 10.0Qwen3-VL-235B 仅 2.1而 v6_tiny 也有 91.0。识别侧15 类场景加权准确率medium 83.2%比 v5_server78.1%高 5.1 个百分点其中日文 16.8%90.5 vs 73.7、屏幕显示 14.4%82.5 vs 68.1、古籍 12.0%72.4 vs 60.4VLM 侧 Qwen3-VL-235B 74.9%、Gemini-3.1-Pro 71.4%、GPT-5.5 64.2%。端到端推理速度s/image200 张图全流程含读图与前后处理硬件后端v6_mediumv6_smallv6_tinyv5_serverNVIDIA A100PaddlePaddle0.290.250.130.32NVIDIA A100TensorRT未公开0.320.16未公开NVIDIA V100ONNX Runtime0.670.530.290.77Intel Xeon 8350COpenVINO1.400.590.207.30Apple M4ONNX Runtime5.551.290.357.20medium 全平台追平或反超上一代 server最夸张的是 Xeon OpenVINO1.40s vs 7.30s快 5.2×。tiny 是跨平台最快的M4 上 0.35sONNX RuntimeA100 上 0.13s适合任何延迟敏感场景。小档换精度几乎不花速度small 与 v5_mobile 速度基本持平但识别准确率高出约 7.6 个百分点81.3% vs 73.7%。快速上手6 行代码跑通端到端 OCRfrom paddleocr import PaddleOCR ocr PaddleOCR(use_doc_orientation_classifyFalse, use_doc_unwarpingFalse, use_textline_orientationFalse) for res in ocr.predict(general_ocr_002.png): res.print()三个use_*开关分别控制文档方向分类、文档矫正、文本行方向分类关掉它们就跳过预处理模块直接走检测→识别速度最快处理倾斜扫描件时改回True即可。默认即使用 PP-OCRv6_medium 端到端管线。命令行方式等价物是一句paddleocr ocr -i 图片路径加同名参数替代引擎只记两个关键参数即可Transformers 引擎传enginetransformers需transformers5.8.0ONNX Runtime 高性能推理传enable_hpiTrue。部署与扩展边界系统与硬件兼容 Windows、Linux、Mac推理支持 NVIDIA GPU、Intel CPU、昆仑芯、昇腾。高性能推理插件enable_hpiTrue启用 HPI 插件自动切换 ONNX Runtime 加速文档见 high_performance_inference.md。服务化部署官方提供高稳定性服务化方案见 serving.md。二次开发入口自定义数据集训练与微调的教程分别见 text_detection.md 与 text_recognition.md词表扩展直接改 ppocrv6_dict.txt 后重训识别头。⚠️限制tiny 档不含日文约 4000 个汉字/假名会撑爆 1.1M 参数的输出层A100 上 medium/small 的 TensorRT 数据官方未公开small 档参数量官方未给出精确值。选型建议与已知边界服务端 / 数据管线选 medium PaddlePaddle 原生推理A100 0.29s/张精度与速度同时压过上一代 serverGPU 批量任务可评估 TensorRT 后端small 档有公开数据 0.32s。移动端 / 桌面端实时场景选 small速度与 v5_mobile 持平但识别准确率高 7.6 个百分点CPU 侧组合 OpenVINO/ONNX Runtime 拿最优延迟。端侧 / IoT选 tinyM4 上 0.35s、Xeon OpenVINO 0.20s跨平台最快前提是业务不依赖日文。已知边界有两个其一精度基准全部来自官方内部评测集公开第三方复现数据目前未公开引入前建议用自己的业务样本集先跑一轮回归其二medium 档在 Apple M4 上 PaddlePaddle 后端需 8.82s/张M 系列芯片上应优先 ONNX Runtime5.55s。PP-OCRv6 把按算力选档位、按语言覆盖选字典这两件事做成了同一套架构下的配置项这正是它值得纳入技术评估清单的理由。【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考