十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Umi-OCR 实战教程:三个场景跑通截图取字、批量识别与 PDF 搜索,全程离线

Umi-OCR 实战教程:三个场景跑通截图取字、批量识别与 PDF 搜索,全程离线 Umi-OCR 实战教程三个场景跑通截图取字、批量识别与 PDF 搜索全程离线【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR截图里想抠出文字、一文件夹扫描件没法一张张处理、PDF 全文搜索一片空白——这些事 Umi-OCR 都能一次办到。它是一款免费开源的离线 OCR 软件解压即用不上传图片、不依赖网络识别全部在你自己的电脑里完成。解压后三步跑通第一次识别发布包是.7z压缩包也有.7z.exe自解压版支持 Windows 7 x64 与 Linux x64没有安装器。解压后双击Umi-OCR.exeLinux 下运行umi-ocr.sh首次打开界面语言会跟随系统自动切换。进「全局设置」页语言、主题、字体、开机自启、OCR 引擎插件都在这里顺手把自启加上。切到「截图 OCR」页按快捷键唤起截图快捷键在该页设置里改鼠标框选区域按Esc可随时取消。识别完成后文字出现在右侧「记录」栏点一下即复制最短路径就此跑通截图 → 识别 → 复制。 把教程截图里的代码直接贴进 IDE想把教程、视频截图里的代码拷进编辑器手敲一遍既慢又容易漏空格普通识别还会把缩进吞掉这一节就解决这件事。在「截图 OCR」页框选代码区域。打开右侧设置面板把「排版解析」选为单栏-保留缩进——它专为代码设计行首缩进和行中空格原样保留。识别完成后在记录栏选中结果直接复制。验证很简单粘进 IDE 或 Markdown 预览缩进层级和原图一致、没有多余空格就过关了。坑预警默认的「多栏-按自然段换行」是为报纸式排版设计的自动识别栏序、按段换行拿它处理代码会丢掉缩进反过来多栏报纸、公文这类文档保持默认的多栏方案即可阅读顺序会自动排对。批量识别整个扫描图文件夹输出 txt 或 Excel几十上百张扫描文档、票据或拍照图一张一张过不现实批量页一次处理完。打开「批量 OCR」页点「选择图片」或直接拖入文件夹。输入支持jpg / jpe / jpeg / jfif / png / webp / bmp / tif / tiff无数量上限。选定输出格式txt / jsonl / md / csv(Excel)。点「开始任务」列表逐张显示识别耗时与置信度。验证随机抽 3 张对照左侧预览和右侧记录置信度0~1低于 0.8 的几张重点人工核对。常见坑有两个每张图都有固定位置的水印或 LOGO 时进右侧设置的忽略区域编辑器按住右键画矩形把水印罩住——只有整个文本块完整落在框内才会被丢弃所以框画大一点更稳图片像素超大的长图先把「设置 → 文字识别 →限制图像边长」从默认 960 调到 2880 或 4320否则图片会先被压缩、小字发糊。把扫描版 PDF 变成可搜索的文件PDF 是纯图片扫描件全文搜索一片空白想引用一句话却找不到在哪页文档识别页v2.1.0 及以上版本就是干这个的。打开「文档识别」标签页拖入文件支持pdf / xps / epub / mobi / fb2 / cbz。只想要正文的话设定忽略区域把页眉页脚排除掉。任务完成后得到双层可搜索 PDF原图还在底层识别出的文字藏在顶层。验证打开生成的 PDF用 CtrlF 搜一个只出现在正文里的词能直接跳到对应页说明文字层写对了。坑预警页眉、页脚、页码的文字会被原样识别进结果记得提前画好忽略区域省得返工想挂机批量跑大批文档可在设置里勾「任务完成后自动关机」。记牢这 5 个设置项缩进、大图、多栏日常基本只用得着这几项其余保持默认设置项何时用建议值为什么排版解析代码截图单栏-保留缩进保留行首缩进与行中空格粘了就能用排版解析多栏报纸、长文档多栏-按自然段换行默认方案自动处理多栏阅读顺序限制图像边长高分辨率大图、小字多2880 或 4320默认 960 会先压缩大图小字易糊语言/模型库纯英文文档、纯代码models/config_en.txt有专门的英文模型库英文场景更准OCR 引擎插件初次使用Rapid-OCR自带兼容性好、速度够用也可在全局设置切换 Paddle-OCR界面改动会自动存到UmiOCR-data/.settingsini 格式可以手改改完执行umi-ocr --reload重载即可v2.1.5 以上支持。 用命令行与 HTTP 接入 OCR 自动化跨进程调用依赖本地 HTTP 服务默认开启主机保持「仅本地」即可默认端口1224。两条路任选命令行umi-ocr即Umi-OCR.exe的简写umi-ocr --screenshot --clip # 截图取字结果进剪贴板 umi-ocr --path D:/docs --output 结果.txt # 整个文件夹批量识别 umi-ocr --qrcode_read D:/code.png # 识别二维码HTTP 接口任何语言都能接GET http://127.0.0.1:1224/api/ocr/get_options # 查询全部参数与默认值 POST http://127.0.0.1:1224/api/ocr # 传 base64 图片 options返回识别文本请求体是一个 JSONbase64放图片编码options放「语言/模型库」「排版解析」等选项。完整参数表见 图片识别接口文档文档识别也有上传/查询/下载接口细节看 api_doc.md。四个常见识别问题速查症状原因解决识别顺序错乱、读不通排版解析方案与图片排版不匹配代码选「单栏-保留缩进」多栏文档用默认多栏方案大图里小字认错默认边长 960 先把图片压缩了「限制图像边长」调到 2880 或 4320水印、LOGO、页眉混进结果该区域的文本块被一起识别批量/文档识别中画忽略区域整个文本块罩住命令行或 HTTP 调用无反应HTTP 服务没开全局设置勾选允许 HTTP 服务主机选「仅本地」把 Umi-OCR 当成你电脑里随叫随到的文字提取组件截图取字、批量导出、PDF 补文字层入口都固定离线完成、图片不出机器。建议先在截图页练熟再上批量与文档页各命令的完整参数在 命令行手册接口用法汇总在 HTTP 接口手册。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表