想给产品加 OCR?装完 Tesseract 再调一堆参数,中英混排还是糊成一团。

想给产品加 OCR?装完 Tesseract 再调一堆参数,中英混排还是糊成一团。

docTR 是个基于 PyTorch 的文字识别库,几行代码就能把 PDF 或图片里的文字整页抓出来。

它走两步:先把每个词在页面上的位置框出来,再把框里的字符读出来。定位和识别用的是两套模型,想换哪套都行。

GitHub:http://github.com/mindee/doctr

开出版面分析后,标题、正文、表格、页眉页脚会被自动分区标注,提取完立刻知道每段文字属于哪里。

扫描件常见的歪斜、旋转也有专门选项处理;输出要正框还是斜框,你自己定。

Hugging Face 上有在线 demo,也提供 Colab,不想装环境就直接网页丢张图先试效果。

项目最早由 Mindee 打磨出来,现在由 t2k 团队接手维护,最近还在持续提交更新。

给自己的项目接一层 OCR,用它比从零训练模型省心得多。


分类