最近研究了一下开源的 OCR 工具 Umi-OCR,发现还挺有意思,顺手整理了一份笔记。
平时看图或者扫描版 PDF 里的文字选不中、无法复制,确实挺让人头疼的,很多在线工具还要收费或者限制次数。这个名为 Umi-OCR 的工具简单理解就是把你截图或者拖进来的图片,直接将里面的文字"抠"出来,变成可以复制和编辑的文本,也就是 OCR 识别。
它最吸引我的一点是完全离线且免费。整个识别过程都是直接在本地电脑上跑的,资料信息不需要上传到任何服务器。对于一些内部文件或者涉密资料来说,用起来安心很多。而且项目本身在 GitHub 上开源,没有会员限制,也没有水印。
Umi-OCR 适合用来做什么
如果你平时经常需要从截图里提取文字,或者要处理扫描件、批量整理图片资料,这个工具感觉会非常实用。
它内置了像 PaddleOCR 和 RapidOCR 这类主流的识别引擎,中文识别效果挺不错的,不管是手写体还是横排竖排都能认出来。我觉得比较有意思的是,它还挺聪明的,会自动帮你忽略掉图片里的一些水印、按钮图标或者页眉页脚,尽可能只留下干净的正文内容。
平时最常用的功能可能就是截图中的文字识别。打开软件后直接用快捷键(默认是 Win+Alt+C)框选区域,文字立刻就出来了。右侧面板还会给段落标记置信度评分,点一下就能复制,非常方便。另外也可以直接在软件里按 Ctrl+V 粘贴剪贴板里的图片来识别。
如果遇到几十上百张图片,或者扫描版的 PDF,可以切换到批量模式。直接把文件拖进去就能自动逐页跑,跑完可以导出 txt、Markdown 或者 jsonl 格式。如果是 PDF,它还可以生成一种“双层可搜索 PDF”,看着还是原来的扫描件,但里面的文字已经可以随意选中和搜索了,这个细节做得蛮用心。
安装和一些实用细节
安装方面非常省心,去 GitHub 直接搜索下载即可,项目地址:
Windows 有两个版本,其中,
Paddle 引擎插件版:性能好,速度快,占用率高,适合高配机器。不兼容奔腾、赛扬、凌动CPU;
Rapid 引擎插件版:速度稍慢,内存占用低,适合低配机器,兼容性好。
纯绿色软件,解压后双击 Umi-OCR.exe 就能直接开跑。
研究过程中也发现几个顺手的小技巧,比如:
可以在设置里框选“忽略区域”,这样识别网页截图或书籍拍照时,页码和广告条就不会混进结果里。
把设置里的开机自启和托盘最小化打开,平时让它待在任务栏右下角,需要的时候直接按快捷键叫出来。
它还自带了一个二维码识别和生成的工具,省去了另外开网页工具的麻烦。
对于有开发需求的朋友,软件还支持开启 HTTP 接口,可以直接把它当成一个本地的免费 OCR 服务来调用。
多语言方面,除了中英文,也支持日文和韩文等语言包切换。
要是遇到识别不太准的情况,除了确保原图清晰度之外,也可以去设置里切换一下识别引擎(比如 RapidOCR 和 PaddleOCR 换着用用看)。觉得批量识别速度慢的话,在性能允许的情况下把线程数调高一点也会有明显提升。
