Python--文字识别--Tesseract
来源:互联网 发布:拜占庭容错共识算法 编辑:程序博客网 时间:2024/05/16 00:57
1.介绍
Tesseract 是一个 OCR 库,目前由 Google 赞助(Google 也是一家以 OCR 和机器学习技术闻名于世的公司)。Tesseract 是目前公认最优秀、最精确的开源 OCR 系统。 除了极高的精确度,Tesseract 也具有很高的灵活性。它可以通过训练识别出任何字体,也可以识别出任何 Unicode 字符。
2.安装
以下所有都是在mac上安装实现的
//安装tesseract的同时安装训练工具brew install --with-training-tools tesseract//安装tesseract的同时安装所有语言,语言包比较大,如果安装的话时间较长,建议不安装,按需选择brew install --all-languages tesseract//安装tesseract,并安装训练工具和语言brew install --all-languages --with-training-tools tesseract //只安装tesseract,不安装训练工具brew install tesseract
3.下载语言库
下载地址:https://github.com/tesseract-ocr/tessdata
默认自带的是英语
根据自己的需求选择所要的语言库,在这里我们选择的是简体中文所以选择的库是:chi_sim.traineddata
将文件拷贝到到:/usr/local/Cellar/tesseract/(你下载的版本号)/share/tessdata目录下。
4.Tesseract的命令行使用
一般使用:
//默认使用eng文字库, imgName是图片的地址,result识别结果tesseract imgName result
指定语言:
//指定使用简体中文tesseract -l chi_sim imgName result//查看本地存在的语言库tesseract --list-langs
指定多语言:
//指定多语言,用+号相连tesseract -l chi_sim+eng imgName result
5.Tesseract在Python中使用
通过 pip 安装支持Python 版本的 Tesseract库
pip install pytesseract
通过Python代码的简单实现
import pytesseractfrom PIL import Imageimage = Image.open('/Users/admin/Desktop/test.jpg')text = pytesseract.image_to_string(image)print text
是爬虫中的验证码的识别,可以通过更换别人训练好的语言包来识别.如果想自己通过训练来获得语言包也是可以的.
6.Tesseract训练
这里放个官方文档,等我练好了再分享
https://github.com/tesseract-ocr/tesseract/wiki
阅读全文
0 0
- Python--文字识别--Tesseract
- python + tesseract OCR 文字识别
- Tesseract ocr文字识别
- Tesseract-ocr-图片文字识别
- 文字识别引擎试用:tesseract-ocr
- tesseract识别图片中文字(一)
- Python_文字识别引擎试用:tesseract-ocr
- Tesseract-OCR 进行文字识别 VS2010
- 使用Tesseract OCR Engine识别图片文字
- 使用Tesseract-OCR训练文字识别记录
- 使用Tesseract-OCR训练文字识别记录
- 使用tesseract进行中文文字识别
- python 做验证码识别 tesseract
- python pytesser tesseract-ocr 验证码识别
- Tesseract 文字识别 运用于ios7 xcode5 任意工程
- 利用开源工具Tesseract进行文字识别
- OpenCV+Tesseract进行OCR学习(二)文字识别
- OpenCV+Tesseract进行OCR学习(二)文字识别
- css实现六边形图片(最简单易懂方法实现高逼格图片展示)
- Kotlin 包和 import 语句使用
- JAVA基础篇
- linux防火墙的配置iptables
- Android事件的分发与消费机制
- Python--文字识别--Tesseract
- window 10下安装python第三方库lxml
- 码农的修行
- maven学习笔记4--Eclipse中m2eclipse插件的安装
- Android Studio中 Logcat窗口的Docked Mode模式选中不了
- 1.1 python入门学习之mac环境配置
- Tensorflow开源的object detection API中的源码解析(一):FASTER RCNN with Inception架构图
- 数组中第一个出现一次的字符
- android gradle build 时出现"Too many open files" 异常