百度此前开源了一个叫 Unlimited-OCR 的 OCR 项目,比较有意思的地方是,它主要针对的就是以前处理 PDF 时比较麻烦的一个问题:文档一长,OCR 就开始折腾人。
普通 PDF 做 OCR,如果页数比较多,经常需要先拆分,再一页一页处理,碰上几十页甚至上百页的论文、报告、合同,整个过程还是挺麻烦的。
Unlimited-OCR 的思路比较直接,主打长文档 OCR,可以对比较长的 PDF 进行连续处理,不需要再手动把文档切成一堆小文件。
项目本身是百度开源的,模型规模大约 30 亿参数,支持多种语言。对于经常需要把 PDF 扫描件转换成可搜索文本的人来说,这种长文档处理能力还是比较实用的。
另外一个我比较关注的地方是可以本地运行。如果手里处理的是合同、论文、内部资料之类的文档,不太希望把文件上传到第三方云 OCR 服务,本地部署会方便很多。
部署方式也比较灵活,项目支持 Transformers、vLLM、Ollama、llama.cpp 等方式,对于喜欢自己折腾本地 AI 模型的人来说,可玩性还是不错的。
项目地址:
如果你平时经常处理几十页、上百页的 PDF,尤其是扫描版论文、书籍、报告或者各种资料,可以把这个项目先收藏起来。
我觉得它最大的看点并不是单纯“又一个 OCR 模型”,而是把重点放在了长 PDF 和本地 OCR 处理上。对于有这类需求的人,确实值得试一下。