十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

PaddleOCR Agent Skills 实践指南:让 AI 应用用自然语言完成 OCR 文字识别与文档解析

PaddleOCR Agent Skills 实践指南:让 AI 应用用自然语言完成 OCR 文字识别与文档解析 PaddleOCR Agent Skills 实践指南让 AI 应用用自然语言完成 OCR 文字识别与文档解析【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCRPaddleOCR 是把图片、PDF 转成结构化数据的轻量级 OCR 工具包它的官方 Agent Skills 把文字识别与文档解析的触发规则、调用步骤、配置要求打包成可按需加载的模块装进支持 Skills 的 AI 应用如 Claude Code、OpenClaw后即可调用官方 API 完成识别。适用前提设备已装 Python 3.9且你的 AI 应用支持加载 Skills。按场景选对 Skill先决定装哪个读完这一节你能对照手头任务直接确定该安装paddleocr-text-recognition还是paddleocr-doc-parsing。只要纯文本就装文字识别 Skill如果你的目标只是把截图、照片、扫描件或扫描版 PDF 里的字读出来选paddleocr-text-recognition。它的输出是行级文本、对应的边界框bbox和置信度分数拿到的是机器可读的字符串。但要记住一条边界文档里只要出现表格、公式、图表或复杂版面就不要用这个 Skill——它的 SKILL.md 明确写明这类输入不适用应改用文档解析 Skill完整规则见 paddleocr-text-recognition/SKILL.md。要保留结构就装文档解析 Skill如果文档含标题、段落、表格、公式或多栏排版这类复杂版面选paddleocr-doc-parsing。它面向发票、财报、学术论文等场景输出 Markdown / 结构化结果能保留文档的原始结构完整规则见 paddleocr-doc-parsing/SKILL.md。一句话选型目标纯文本 →paddleocr-text-recognition要结构 →paddleocr-doc-parsing。两个 Skill 按需装其一即可源码都在仓库的 skills/ 目录下。准备与安装PaddleOCR skill 装进设备读完这一节你的设备上就同时备好了运行依赖和 Skill 本体。备齐三样Python、PaddleOCR 3.7.0、access token确认执行 Skill 的设备已安装 Python 3.9 或以上版本安装 PaddleOCR 3.7.0 及以上版本pip install paddleocr3.7.0获取 access token访问百度 AI Studio 的 Access Token 页面账户设置中的 accessToken 入口拿到。这里有个省心的事实Skill 内部调用的paddleocr api是把文件 URL 或本地文件提交到官方托管服务、等待任务完成并输出结果的子命令它不跑本地推理所以装完 PaddleOCR 后既不需要 GPU也不需要额外依赖组。推荐方式一条命令装好npx skills前提设备已安装 Node.js。skillsCLI 会把 Skill 全局安装到设备上装完各 AI 应用都能用npx skills add PaddlePaddle/PaddleOCR -g --skill paddleocr-text-recognition -y npx skills add PaddlePaddle/PaddleOCR -g --skill paddleocr-doc-parsing -y只装其中一个就保留对应的单条命令。如果网络较慢导致npx skills add超时失败PaddleOCR 仓库较大兜底做法是先把仓库克隆到本地再从本地路径安装git clone https://gitcode.com/GitHub_Trending/pa/PaddleOCR npx skills add ./PaddleOCR/skills/paddleocr-text-recognition npx skills add ./PaddleOCR/skills/paddleocr-doc-parsing备选方式clawhub 安装OpenClaw如果你用的是 OpenClawclawhub install paddleocr-text-recognition clawhub install paddleocr-doc-parsing安装位置与规则以 OpenClaw 官方 Skills 文档为准。兜底方式手动拷贝 Skill 目录上面两条路都不通时克隆仓库把PaddleOCR/skills下对应的 Skill 目录拷贝到你 AI 应用指定的位置即可。具体拷到哪里参考对应应用的安装文档——Claude Code、claude.ai、OpenClaw 各自有 Skills 安装说明。配置 token让 Skill 能通过认证读完这一节Skill 就能带着有效凭证访问官方服务。按 官方文档 的要求环境变量有两个必填PADDLEOCR_ACCESS_TOKENaccess token可选PADDLEOCR_BASE_URLAPI base URL缺省使用官方服务地址两个 Skill 的 frontmatter 都把PADDLEOCR_ACCESS_TOKEN声明为必需环境变量primaryEnv缺了它 Skill 不会正确工作。Claude Code在项目根目录的.claude/settings.local.json中添加env字段ACCESS_TOKEN替换为你在 AI Studio 获取的 token{ env: { PADDLEOCR_ACCESS_TOKEN: ACCESS_TOKEN } }OpenClaw在~/.openclaw/openclaw.json中添加 Skill 配置enabled置为true并在每个 Skill 的env中填入 token{ skills: { entries: { paddleocr-text-recognition: { enabled: true, env: { PADDLEOCR_ACCESS_TOKEN: ACCESS_TOKEN } }, paddleocr-doc-parsing: { enabled: true, env: { PADDLEOCR_ACCESS_TOKEN: ACCESS_TOKEN } } } } }如果你的 AI 应用不在上面列举范围内把 token 以环境变量PADDLEOCR_ACCESS_TOKEN提供给该应用即可也可以改用--token参数在单次调用时显式传入。调用与验证一句话触发看输出判成败读完这一节你能用自然语言发起任务并从 JSON 输出里判断结果是否可用。用自然语言触发任务配置完成后直接用自然语言描述任务并附上文件 URL 或本地路径让 AI 应用调用对应 Skill。paddleocr-text-recognition提取这个文件中的全部文本https://example.com/invoice.jpg提取本地文件 C:\docs\invoice.pdf 中的全部文本。paddleocr-doc-parsing解析这个 PDF并返回主体内容和全部表格https://example.com/report.pdf解析本地文件 C:\docs\report.pdf并返回完整结构化结果。上面https://example.com/...与C:\docs\...都是示例值替换为你自己的文件 URL 或本地路径。底层是 paddleocr api 命令Skill 内部实际执行的是paddleocr api。想理解 Skill 行为或手动验证时记住它的常用形态--model_type必填可选值为ocr或doc_parsing--file_url与--file_path必须二选一paddleocr api \ --model_type ocr \ --file_url https://example.com/image.pngpaddleocr api \ --model_type doc_parsing \ --file_path ./document.pdf完整参数列表以paddleocr api --help为准详见 官方 API CLI 文档。看输出判断是否成功成功时paddleocr api输出格式化 JSON顶层是jobId和每页的pages。文字识别--model_type ocr每页含prunedResult、ocrImageUrl其中prunedResult内含rec_texts行级文本与rec_scores置信度分数。结构示例如下数值仅为示例{ jobId: job-xxx, pages: [ { prunedResult: { rec_texts: [Line 1, Line 2], rec_scores: [0.98, 0.95] }, ocrImageUrl: https://... } ] }文档解析--model_type doc_parsing每页含markdownText、markdownImages、outputImages数值仅为示例{ jobId: job-xxx, pages: [ { markdownText: # Title\n\nContent..., markdownImages: { img1: https://... }, outputImages: { layout1: https://... } } ] }验证方式就是检查pages是否覆盖目标页码、rec_texts/markdownText的内容是否与文档实际内容一致。展示时向用户呈现完整提取内容只有超过 10,000 字符才允许省略。另外若用--output指定了文件CLI 会写入该文件并打印保存位置未指定时直接打印到标准输出。排错速查失败信号、三类错误与预处理开关读完这一节调用出错时你能快速定位原因并为不同输入决定要不要开预处理。三类常见错误与判断线索命令出错时信息输出到标准错误流stderr并返回非零退出码——看到这两个信号即可判定调用失败。SKILL.md 列出的常见错误有三类认证错误PADDLEOCR_ACCESS_TOKEN无效或缺失——先检查环境变量是否配置、token 是否来自 AI Studio 且未过期配额错误API 限流或配额超出未检测到内容图片可能是空白页或不含文字。有一条硬性纪律CLI 返回错误时必须向用户说明具体问题禁止静默失败也禁止回退到 AI 应用自身的视觉能力。预处理开关什么时候可以关API 默认启用文档预处理包括扭曲矫正use_doc_unwarping与方向分类use_doc_orientation_classify。对于平整、方向正确的输入截图、扫描规范的文档可以关掉以加快结果paddleocr api --model_type ocr --file_path ./document.pdf \ --use_doc_unwarping False --use_doc_orientation_classify False以下情况应保留预处理输入是弯曲或折叠文档的照片、存在明显透视变形、方向不确定旋转 90/180/270 度。最后拿一篇你手头的真实 PDF 或图片走一遍上面的自然语言提示输出中出现与文档一致的rec_texts或markdownText就说明从安装、配置到调用的整条链路已经打通。【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表