十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Umi-OCR 实战指南:三步用会免费离线 OCR,截图、批量、PDF 一次搞定

Umi-OCR 实战指南:三步用会免费离线 OCR,截图、批量、PDF 一次搞定 Umi-OCR 实战指南三步用会免费离线 OCR截图、批量、PDF 一次搞定【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源、完全离线的 OCR 文字识别工具不联网也能识别截图、批量图片与 PDF 扫描件中的文字还顺带支持二维码扫描与生成。全文按为什么用它 → 怎么最快上手 → 真实场景实战 → 调优 → 避坑的顺序带你过一遍。它凭什么值得装一段话概括这是一套解压即用的本地文字识别方案识别过程全部发生在你的机器上图片不出内网、不上传云端对资料保密性要求高的场景合同、病历、内部文档尤其安心。完全免费开源无会员、无次数限制、无水印代码可自由研究二次开发离线运行内置 OCR 引擎与多国语言模型库断网环境照常工作场景覆盖全截图识别、批量图片、PDF 文档识别、二维码扫描/生成一个标签页一个功能多语言界面跟随系统自动切换也可手动改成英文、日文、繁中等从零开始的最短上手路径第 1 步安装其实是解压从发行版拿到.7z压缩包或.7z.exe自解压包解压后无需任何安装步骤直接运行Umi-OCR.exeLinux 用户用umi-ocr.sh启动即可看到主界面。第 2 步完成第一次识别打开顶部的截图OCR标签页按下截图快捷键在屏幕上框选一块区域右侧记录栏立刻出现识别文字。识别结果可以直接划选复制也可以右键图片预览区复制整段文字。第 3 步导出结果把文字留在剪贴板就完成 80% 的需求想落盘的话除了界面操作还有一条更快的路——命令行一行把识别结果写进文件# 唤起截图识别识别完成后把纯文本写入 test.txt umi-ocr --screenshot --output test.txt这条命令做的事截屏 → 识别 → 保存文件全程不用碰鼠标。更多写法范围截图、读取剪贴板图片、指定文件路径见 命令行手册。三个真实工作场景实战场景一开会投屏的 PPT文字怎么快速搬进纪要一句话痛点台上讲了四十分钟你不可能一边听一边把要点逐字敲下来。解决思路截图 OCR 排版解析。投屏画面框选即识别多页内容逐张截图右侧记录栏会按顺序堆叠多条记录最后一次性整理。操作步骤打开截图OCR页对投屏区域截图框选识别文字出现在记录栏对多个要点重复截图记录栏可滚动查看、勾选多条右键记录区选择复制选中全部粘贴进你的纪要文档效果说明如果 PPT 是双栏版式把设置里的排版解析方案切到多栏-按自然段换行输出顺序会更贴近阅读习惯识别结果支持直接编辑错字改完再复制。场景二扫描版 PDF 搜不到内容转成双层可搜索 PDF一句话痛点一份 200 页的扫描合同CtrlF毫无作用找一条条款只能一页页翻。解决思路使用文档识别标签页对扫描件做 OCR 并输出双层可搜索 PDF——原文图层保留文字图层叠加在上层之后就能全文检索、划选复制。操作步骤打开文档识别页导入 PDF同样支持xps / epub / mobi / fb2 / cbz如每页有固定页眉页脚进入忽略区域编辑器按住右键画矩形框盖住干扰文字选择输出双层可搜索 PDF开始任务效果说明几百页文档建议放在睡前挂机跑任务完成后还可以勾选自动关机/待机。忽略区域规则是整个文本块被框住才丢弃画框时宁可大一点别把正文切进去。场景三一整个文件夹的笔记截图批量转 Markdown 存档一句话痛点手机拍了几十张课堂笔记和手写板一张张截图识别太磨人还容易漏图。解决思路批量 OCR 标签页一次吃下整个文件夹支持jpg / png / webp / bmp / tif等格式识别结果按你选的格式统一导出。操作步骤打开批量OCR页点击选择图片直接选中整个文件夹嵌套子文件夹也会被扫到右栏设置中选择导出格式md / txt / csv(Excel) / jsonl点击开始任务左栏实时显示每张图的耗时与置信度效果说明导出 Markdown 后可以直接丢进笔记软件导出 CSV 则能直接进 Excel 做二次整理。批量页同样支持文本后处理与忽略区域和水印文档批量处理是同一套玩法。让识别更快更准的调优手册先选对引擎你的素材推荐引擎理由代码截图、版面简单的图RapidOCR轻量、出结果快复杂版面、倾斜文本、多语言长文PaddleOCR模型库更全精度更高两者都是离线引擎在全局设置里随时切换无需重装。五个关键参数配置文件位于./UmiOCR-data/.settingsini 格式界面改动都会写回这里也可以手改后用umi-ocr --reload重新加载参数作用建议ocr.language语言模型库中文、英文、日文、韩文、俄文等按需选ocr.limit_side_len图像边长上限默认 960 偏快大图精度不够时调 2880 / 4320ocr.cls纠正文本方向拍歪的照片开启速度略降tbpu.parser排版解析方案代码用single_code正文用multi_paratbpu.ignoreArea忽略区域批量排除水印、页眉页脚针对大尺寸扫描页 英文 需要方向纠正的典型组合配置长这样; ./UmiOCR-data/.settings 关键参数示例 ocr.language models/config_en.txt ; 英文模型 ocr.limit_side_len 4320 ; 大图保留更多细节 ocr.cls true ; 识别倾斜/倒置文本 tbpu.parser multi_line ; 多栏-总是换行 data.format text ; 返回纯文本界面侧的语言、主题、引擎切换入口都在全局设置页进阶把识别接进你的脚本命令行之外Umi-OCR 还内置了默认端口1224的 HTTP 服务仅本地环回不经过网卡可以用它做自动化。批量跑一个目录、结果追加到文件# 识别整个文件夹中的全部图片结果写入 result.txt umi-ocr --path D:/notes/scan --output D:/notes/result.txt从 Python 调用 HTTP 接口识别单张图核心就四行import base64, requests payload { base64: base64.b64encode(open(D:/notes/page1.png, rb).read()).decode(), options: {ocr.language: models/config_en.txt, tbpu.parser: multi_line}, } print(requests.post(http://127.0.0.1:1224/api/ocr, jsonpayload, timeout30).json()[data])接口全部参数与返回结构见 HTTP 接口手册 和 图片识别 API。你可能踩的坑与解法坑 1识别顺序乱段落串在一起现象双栏排版被先读完左栏再右栏地输出。原因默认排版方案没匹配版面。解法设置里切换tbpu.parser双栏选多栏-按自然段换行代码截图选单栏-保留缩进。坑 2大图识别慢现象几万像素的手机照片排队等半天。原因原图直接进模型。解法ocr.limit_side_len保持默认 960 即可只有发现小字漏识别时再逐步调高到 2880 或 4320。坑 3水印、页眉混进结果现象每页右下角的 LOGO 文字都出现在导出文件里。原因没有设忽略区域。解法批量/文档页的忽略区域编辑器里按住右键画框注意只有整块文本落在框内才丢弃画框要能完整包住水印可能出现的范围。坑 4命令行没反应现象终端输入umi-ocr提示找不到命令或任务不执行。原因Umi-OCR 的命令行依赖内置 HTTP 服务服务被关掉了。解法全局设置中确认 HTTP 服务开启、主机选仅本地即可。坑 5斜着拍的文本识别不准现象手机随手拍的倾斜文档个别行错位。原因文字方向与模型假设不符。解法开启ocr.cls方向纠正PaddleOCR 引擎下生效或用文档识别页先把页面摆正再识别。收尾它最适合谁以及往哪走核心价值一句话回顾免费、离线、覆盖截图/批量/PDF/二维码的本地 OCR 工作台——隐私敏感的资料可以放心丢进去断网环境也不掉链子。给你的三条使用建议日常随手用只装截图OCR一个标签页快捷键框选即走大批量任务用批量OCR/文档识别页 忽略区域睡前挂机、完成后自动关机要集成进流程命令行 HTTP 接口二选一参数全部可脚本化延伸阅读均为项目内文档命令行手册--screenshot、--path、--output等指令细节HTTP 接口手册服务开关、端口与接口总览图片识别 APIBase64 识别接口的完整参数表更新日志版本变化与新功能时间线源码目录UmiOCR-data/py_src/Python 源码方便二次开发照着上手三步 三个场景走完你已经会用它的 90%剩下的调优和自动化随用随查上面这几份文档就行。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表