Python2.7利用Tesseract进行中英文图像识别,,背景环境: win8
Python2.7利用Tesseract进行中英文图像识别,,背景环境: win8
背景环境: win8.1 64位 python2.7.13
本以为会很简单,结果在配置环境这块上花了很多时间,踩了几个坑,最后自己看英文文档和log才解决问题。
打开网站
https://pypi.python.org/pypi/pytesseract
https://github.com/tesseract-ocr/tesseract/wiki
https://github.com/tesseract-ocr/tesseract/wiki/Downloads
http://www.pythonware.com/products/pil/
找到并下载安装tesseract-ocr-setup-4.00.00dev.exe文件 下载中文训练库chi_sim.traineddata
将安装文件路径 添加到环境变量中的PATH 和 Path中去 ,在系统变量中添加一个TESSDATA_PREFIX,变量值还是文件路径
我的是D:\programfiles\tesseract\Tesseract-OCR
打开cmd安装 pip install pytesseract
去C:\Python27\Lib\site-packages 下找到PIL卸载 然后去下载PIL-1.1.7.win32-py2.7.exe 并安装
# -*- coding: utf-8 -*-try: import Imageexcept ImportError: from PIL import Imageimport pytesseractimg = Image.open(‘test2.png‘)img.load()text = pytesseract.image_to_string(img, lang=‘chi_sim‘)print(text)
最后找张png的图放在和这个文件同目录下 完事了
几个坑:
:from . import VERSION, PILLOW_VERSION, _plugins ueError: Attempted relative
不知道什么鬼,后来直接把C:\Python27\Lib\site-packages\PIL 给删了 重新安装这个库
pytesseract.pytesseract.TesseractError: (1, u‘Error opening data file D:\\programfiles\\tesseract\\Tesseract-OCR/chi_sim.traineddata‘)
这里需要将chi_sim.traineddata放在指定目录下,而不是 $path\tessdata\tessconfigs下
总结: 看官方教程 百度上搜索的太旧了 stackoverflow 也是
Python2.7利用Tesseract进行中英文图像识别
相关内容
- python---win32gui:winAPI操作,,python操作wi
- Python中*args和**kwargs的区别,,一、*args的使用
- python文件、文件夹的移动、复制、删除、重命名,,im
- python 小练习 11,,桌子上有一堆数量不超
- python+robot framework接口自动化测试,,python+req
- 08:robotframework变量文件与python测试库,,01:变量表中声
- python turtle库的几个小demo,,一、先上图一个同切圆
- python2.7打印中文内容,,尝试了很多办法,终于
- 求你了,别再用print调试代码了,
- Linux wget命令下载各版本的Python方法,, python3.
评论关闭