十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Umi-OCR 离线OCR实战指南:截图、批量、PDF识别三件事一次搞定

Umi-OCR 离线OCR实战指南:截图、批量、PDF识别三件事一次搞定 Umi-OCR 离线OCR实战指南截图、批量、PDF识别三件事一次搞定【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源的离线OCR软件截图取字、批量图片识别、PDF 扫描件转可搜索文本全在本地完成不联网、图片不上传。这篇带你从解压到跑通三个最常用的任务再告诉你怎么用命令行或 HTTP 接口把它接进自动化。 第一次跑通解压、启动、截个图试试发布包是.7z压缩包也有.7z.exe自解压版Windows 7 x64 和 Linux x64 都支持无需安装、无需注册Windows 找到Umi-OCR.exe双击Linux 环境跑umi-ocr.sh首次打开界面语言跟随系统设置想换语言去全局设置 → 语言繁中、英文、日文都能切打开截图OCR标签页按截图快捷键框选屏幕区域Esc取消文字自动落到右侧记录面板划选即可复制主界面左侧预览可划选文字右侧记录按时间保存每次识别结果同一套界面还能并排显示多语言切换不重学 三个高频任务代码截图带缩进直接贴进IDE谁会遇到文档、视频里看到一段代码想贴进 IDE 复现手敲又慢普通截图OCR还会把缩进吞掉。截图OCR页框选代码区域右侧设置里把排版解析换成单栏-保留缩进识别完直接从记录里复制OCR 引擎只负责认字排版解析负责按阅读顺序把文字块拼回去这个方案就是为代码设计的行首缩进、行中空格全保留。合格线贴进 IDE 后缩进层级与原图一致、没有多余空格。一文件夹扫描图批量转成txt和Excel谁会遇到手里一批扫描文档、票据、拍照图片一张张识别不现实。批量OCR页选图片或直接拖入文件夹没有数量上限输入支持jpg / jpeg / jfif / png / webp / bmp / tif / tiff输出可选txt / jsonl / md / csv(Excel)点开始任务左侧列表逐张显示耗时和置信度0~1每张图都有固定位置的水印或 LOGO 时进右侧设置的忽略区域编辑器按住右键画矩形只有完全落在框内的文本块会被丢弃框画大一点更稳。合格线随机抽 3 张图对比预览与记录置信度低于 0.8 的几张重点人工核对。扫描件PDF变成能CtrlF的文档谁会遇到PDF 是纯图片扫描版全文搜索是空的想引用一句话却翻不到页。打开文档识别页拖入文档支持pdf / xps / epub / mobi / fb2 / cbz可设忽略区域排除页眉页脚只认正文任务结束得到双层可搜索PDF原图在底下、识别文字在顶上版面不丢还能搜能选合格线打开生成的 PDFCtrlF搜一个只在正文出现的词能跳到正确页即过关。 值得动手的几项设置日常基本只用这几项其余保持默认设置项什么时候调建议值调了会怎样排版解析方案代码截图单栏-保留缩进行首缩进与行中空格保留可直接粘贴排版解析方案多栏报纸、长文档多栏-按自然段换行默认方案自动理顺多栏阅读顺序限制图像边长大图、小字多2880 或 4320默认 960 会先压缩大图小字发糊调高更准语言/模型库英文文档、纯代码models/config_en.txt中文模型认纯英文可能出怪字符OCR引擎插件想换一套引擎Rapid-OCR自带兼容性好、速度够全局设置里可切换界面改动会自动存进UmiOCR-data/.settingsini 格式手动改完执行umi-ocr --reloadv2.1.5 起支持即可刷新。 接进自动化命令行与HTTP二选一前提全局设置里允许 HTTP 服务默认开启主机保持仅本地指令只走本机环回、不出网。命令行入口就是主程序umi-ocr是Umi-OCR.exe的简写umi-ocr --screenshot --clip # 截图识别结果进剪贴板 umi-ocr --path D:/docs --output 结果.txt # 整个文件夹批量识别并写文件 umi-ocr --qrcode_read D:/code.png # 读取图片里的二维码注意 shell 的重定向和|管道可能失效写文件请用--output。HTTP 这条线记住一件事就行默认端口1224先用GET http://127.0.0.1:1224/api/ocr/get_options查有哪些参数和默认值再向POST http://127.0.0.1:1224/api/ocr提交 base64 编码的图片即可取回识别文本完整参数表见 图片识别接口文档。 出问题了查这里命令行 / HTTP 没反应多半是 HTTP 服务没开。全局设置里勾选允许 HTTP 服务主机选仅本地。HTTP 偶尔报ECONNREFUSED的话重发一次请求即可。识别顺序错乱、读不通排版解析方案和图里的排版对不上。代码图换单栏-保留缩进多栏文档用多栏-按自然段换行。大图里的小字认错默认边长限制 960 会先压缩大图。把限制图像边长调到 2880 以上再看。水印、LOGO 混进结果水印里的文本块被一起认了。批量识别里画忽略区域右键画矩形把水印位置整个包住。Umi-OCR 像个放在本地的 OCR 工具箱免费、离线截图/批量/PDF 三件事一次做完还留了命令行和 HTTP 两个口子接自动化。建议先在截图页练熟再用批量页处理文件夹。延伸阅读命令行手册 · HTTP接口手册 · 图片识别接口文档【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表