百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术资源 > 正文

图片表格识别、提取和保存:python-opencv-pytesseract-csv

off999 2024-12-01 02:17 21 浏览 0 评论

一、先看看效果:

二、点评:

1 这是一个完整版的教程,从图片处理、文字识别、数据保存和相关软件安装,比较完整,适合练手、学习。

2 文字中“男女”识别不出来,可能与我的调试没有到位,或者原图表格中的文字是粗体有关。

3 虽然有小bug,但是讲解清楚,注释详细,文章较长,适合收藏,慢慢学习。

三、内容:

1 代码分步讲解,图文并茂。

2 完整代码(精简版)。

3 pytesseract软件安装,因为这个软件安装比较特殊,有时候可能会有一些麻烦,故我特别放在此处交代一下。

四、代码分步讲解:

1 原图:abc.png

2 第一步:导入模块

import re
import cv2
import numpy as np
import pytesseract

3 第二步:图片处理

# 2-1 读取识别图片的表格原图
src='/home/xgj/Desktop/png-table-word/120/img/abc.png'
raw = cv2.imread(src, 1)
# 2-2 初步处理
# 灰度图片
gray = cv2.cvtColor(raw, cv2.COLOR_BGR2GRAY)
# 二值化
binary = cv2.adaptiveThreshold(~gray, 255, cv2.ADAPTIVE_THRESH_GAUSSIAN_C, cv2.THRESH_BINARY, 35, -5)
#cv2.imshow("1", binary) #展示图片
#cv2.waitKey(0)

横线识别,很重要,scale = 18需要自己调节。

rows,cols=binary.shape
# 需要自己调节-1
scale = 18   # 越大越容易识别文字横线,引起误差,22误差就大。
#识别横线
kernel = cv2.getStructuringElement(cv2.MORPH_RECT,(cols//scale,1))
eroded = cv2.erode(binary,kernel,iterations = 1)
#cv2.imshow("2",eroded)
dilatedcol = cv2.dilate(eroded,kernel,iterations = 10)
#cv2.imshow("3",dilatedcol)
#cv2.waitKey(0)

竖线识别,也是一样的。

# 2-4 识别竖线
# 需要自己调节-2
scale = 10  # 调成10,如果20太敏感了
kernel = cv2.getStructuringElement(cv2.MORPH_RECT,(1,rows//scale))
eroded = cv2.erode(binary,kernel,iterations = 1)
dilatedrow = cv2.dilate(eroded,kernel,iterations = 10)
#cv2.imshow("4",dilatedrow)  
#cv2.waitKey(0)

交点显示,很重要,容易遗漏。

# 2-5 标识交点,关键处,后面需要提取,用来截取小单元格
bitwiseAnd = cv2.bitwise_and(dilatedcol,dilatedrow)
cv2.imshow("5",bitwiseAnd)
cv2.waitKey(0)
# 2-6 标识表格
merge = cv2.add(dilatedcol,dilatedrow)
cv2.imshow("6",merge)
cv2.waitKey(0)

# 查看效果,用于提取后的文字识别,很重要
# 2-7 两张图片进行减法运算,去掉表格框线
merge2 = cv2.subtract(binary,merge)
cv2.imshow("7",merge2)
cv2.waitKey(0)

第三步:获取左上角的交点,并截取每一个小单元格

# 3-1 识别黑白图中的白色交叉点,将横纵坐标取出
ys,xs = np.where(bitwiseAnd>0)
mylisty=[] #纵坐标
mylistx=[] #横坐标
#通过排序,获取跳变的x和y的值,说明是交点
i = 0
myxs=np.sort(xs)
#print(myxs) 
for i in range(len(myxs)-1):
  # 需要自己调节-3
  if(myxs[i+1]-myxs[i]>5):  # 自定义:5
    mylistx.append(myxs[i])
  i=i+1
mylistx.append(myxs[i])

i = 0
myys=np.sort(ys)
#print(myys)
for i in range(len(myys)-1):
  # 需要自己调节-3
  if(myys[i+1]-myys[i]>5): #5
    mylisty.append(myys[i])
  i=i+1
mylisty.append(myys[i])

#print(mylisty)
#print('mylisty',mylisty)
#print('mylistx',mylistx)

# 3-2 截取小单元格
# 定义一个空格数据列表
data = [[] for i in range(len(mylisty)-1)]
#print(data)

#循环y坐标,x坐标分割表格
for i in range(len(mylisty)-1):
  for j in range(len(mylistx)-1):
    #在分割时,第一个参数为y坐标,第二个参数为x坐标
    ROI = merge2[mylisty[i]:mylisty[i+1],mylistx[j]:mylistx[j+1]] 
    #ROI = raw[mylisty[i]:mylisty[i+1],mylistx[j]:mylistx[j+1]]  # 原图识别率不高
    cv2.imshow("sub_pic" + str(i) + str(j), ROI)
    #cv2.waitKey(0)
    # 识别
    #text1 = pytesseract.image_to_string(ROI) #读取文字,此为默认英文
    text1 = pytesseract.image_to_string(ROI, lang='chi_sim+eng') #读取文字,此为默认英文
    # 去除特殊字符
    text1 = re.findall(r'[^\*"/:?\\|<>″′‖〈\n]', text1, re.S)
    text1 = "".join(text1)
    print('单元格图?信息:' + text1)
    data[i].append(text1)
    j=j+1
  i=i+1

# 查看识别效果
print(data)
#[['姓名', '性别', '编号'], ['张三', '', 'N01'], ['李四', '', 'N02'], ['小明', '', 'No3']]
cv2.waitKey(0)

第四步:存入文件中

# 第四步:存入csv中
import csv
path='/home/xgj/Desktop/png-table-word/120/data.csv'
with open(path, "w", newline='') as csv_file:
      writer = csv.writer(csv_file, dialect='excel')
      for index, item in enumerate(data):
            writer.writerows([[item[0], item[1], item[2]]]) # 有三列,可以自己根据原表格定义

五、完整代码:精简版

# -*- coding: utf-8 -*-
# 第一步:导入模块
import re
import cv2
import csv
import numpy as np
import pytesseract

# 第二步:图片处理
# 2-1 读取识别图片的表格原图
src='/home/xgj/Desktop/png-table-word/120/img/abc.png'
raw = cv2.imread(src, 1)

# 2-2 初步处理
# 灰度图片
gray = cv2.cvtColor(raw, cv2.COLOR_BGR2GRAY)
# 二值化
binary = cv2.adaptiveThreshold(~gray, 255, cv2.ADAPTIVE_THRESH_GAUSSIAN_C, cv2.THRESH_BINARY, 35, -5)

# 2-3 识别横线
rows,cols=binary.shape
scale = 18   # 越大越容易识别文字横线,引起误差,22误差就大。
#识别横线
kernel = cv2.getStructuringElement(cv2.MORPH_RECT,(cols//scale,1))
eroded = cv2.erode(binary,kernel,iterations = 1)
dilatedcol = cv2.dilate(eroded,kernel,iterations = 10)

# 2-4 识别竖线
scale = 10  # 调成10,如果20太敏感了
kernel = cv2.getStructuringElement(cv2.MORPH_RECT,(1,rows//scale))
eroded = cv2.erode(binary,kernel,iterations = 1)
dilatedrow = cv2.dilate(eroded,kernel,iterations = 10)

# 2-5 标识交点,关键处,后面需要提取,用来截取小单元格
bitwiseAnd = cv2.bitwise_and(dilatedcol,dilatedrow)
cv2.imshow("5",bitwiseAnd)
cv2.waitKey(0)

# 2-6 标识表格
merge = cv2.add(dilatedcol,dilatedrow)
cv2.imshow("6",merge)
cv2.waitKey(0)

# 查看效果,用于提取后的文字识别,很重要
# 2-7 两张图片进行减法运算,去掉表格框线
merge2 = cv2.subtract(binary,merge)
cv2.imshow("7",merge2)
cv2.waitKey(0)

# 第三步:获取左上角的交点,并截取每一个小单元格
# 3-1 识别黑白图中的白色交叉点,将横纵坐标取出
ys,xs = np.where(bitwiseAnd>0)
mylisty=[] #纵坐标
mylistx=[] #横坐标

i = 0
myxs=np.sort(xs)
for i in range(len(myxs)-1):
  if(myxs[i+1]-myxs[i]>5):  # 自定义:5
    mylistx.append(myxs[i])
  i=i+1
mylistx.append(myxs[i])

i = 0
myys=np.sort(ys)
for i in range(len(myys)-1):
  if(myys[i+1]-myys[i]>5): #5
    mylisty.append(myys[i])
  i=i+1
mylisty.append(myys[i])

# 3-2 截取小单元格
# 定义一个空格数据列表
data = [[] for i in range(len(mylisty)-1)]

#循环y坐标,x坐标分割表格
for i in range(len(mylisty)-1):
  for j in range(len(mylistx)-1):
    #在分割时,第一个参数为y坐标,第二个参数为x坐标
    ROI = merge2[mylisty[i]:mylisty[i+1],mylistx[j]:mylistx[j+1]] 
    cv2.imshow("sub_pic" + str(i) + str(j), ROI)
    # 识别
    text1 = pytesseract.image_to_string(ROI, lang='chi_sim+eng') #读取文字,此为默认英文
    # 去除特殊字符
    text1 = re.findall(r'[^\*"/:?\\|<>″′‖〈\n]', text1, re.S)
    text1 = "".join(text1)
    print('单元格图?信息:' + text1)
    data[i].append(text1)

    j=j+1
  i=i+1

cv2.waitKey(0)

# 第四步:存入csv中
# 自定义存入文件地址和文件名
path='/home/xgj/Desktop/png-table-word/120/data.csv'
# 写入
with open(path, "w", newline='') as csv_file:
      writer = csv.writer(csv_file, dialect='excel')
      for index, item in enumerate(data):
            writer.writerows([[item[0], item[1], item[2]]]) # 有三列,可以自己根据原表格定义

六、pytesseract安装:

1、先安装tesseract-ocr:

sudo apt-get install tesseract-ocr  # 本机是deepin-linux操作系统

2、测试:

tesseract -v

3、安装pytesseract:

sudo pip3.8 install pytesseract  # 本机是python3.8

4、查看语言包tesseract:

tesseract --list-langs

初始安装,查看效果如下:

tesseract --list-langs

osd

eng

equ

Note: These two data files are compatible with older versions of Tesseract.

osd is compatible with version 3.01 and up,

and equ is compatible with version 3.02 and up.

没有安装中文简体包。

5、安装中文简体包:

https://github.com/tesseract-ocr/tessdata  # 下载地址

下载,解压,本机是将chi_sim.traineddata复制到下面文件夹下,注意sudo

/usr/share/tesseract-ocr/tessdata

在查看。

小结:

自己实测和操作过,细节也注释了。

赋诗一首,更显原创。

===========

缝隙爱好学习,

实测代码详细,

图文并茂有心,

快乐分享搭梯。

===========

相关推荐

wps截图快捷键(WPS截图快捷键是哪个)

在WPS中进行截屏,可以通过快捷键来实现。具体操作在按下“Alt+PrtSc”之后,就会将当前屏幕截图保存到剪贴板中。若需要将截图保存为图片文件,则在粘贴时选择“文件夹”而不是“粘贴”,再选定存储...

台式电脑最佳配置清单及价格
  • 台式电脑最佳配置清单及价格
  • 台式电脑最佳配置清单及价格
  • 台式电脑最佳配置清单及价格
  • 台式电脑最佳配置清单及价格
电脑主机自动关机是什么原因

  原因一、软件  1.病毒破坏,自从有了计算机以后不久,计算机病毒也应运而生。当网络成为当今社会的信息大动脉后,病毒的传播更加方便,所以也时不时的干扰和破坏我们的正常工作。比较典型的就是前一段时间对...

显示桌面快捷键(怎么设置桌面快捷图标)

电脑上显示桌面的快捷键如下:1,常用。同时按Win徽标键+D键(win键位于Ctrl与Alt之间像个飘起来的田字):按一次显示桌面,再同时按一次返回到窗口。2,同时按Win徽标键+M:原本含义是“...

如何使用u盘拷贝文件(如何使用u盘拷贝文件到电脑)

1、插入u盘,在桌面上或“我的电脑”中能查看u盘信息。2、在电脑中找到需要拷贝的文件,右键点击复制。3、进入u盘界面,在空白处点击右键,选择“粘贴”即可拷贝到u盘。或者,同时打开需要复制的文件窗口和u...

win10官方iso镜像下载地址(win10官方iso镜像怎么安装)

您好,要安装Windows10原装ISO镜像,您可以按照以下步骤进行操作:1.首先,确保您拥有可用的Windows10原装ISO镜像文件。您可以从Microsoft官方网站下载或通过其他合法渠道...

暴风激活工具激活不了(暴风激活工具激活不了office)

本人认为是安全的,原因如下:(1)跟其他激活工具相比,它体积最小!会干闲事的工具,其代码会较多,因此体积一般也较大;(2)能离线激活!在众多工具中,暴风激活工具是离线激活的.若体积小还...

笔记本电脑连接上wifi却不能上网

1、鼠标右键我的电脑(计算机,win8里叫这台电脑),然后再点击管理。2、进入管理列表后,点击服务和应用程序,在点击里面的服务。在服务中找到WLANAutoConfig,把这个服务改为自动,并且点...

安卓商店下载(安卓商店下载安装到手机)

要限制华为iPad上的下载,您可以按照以下步骤进行操作:首先,打开设置菜单,然后选择应用和通知。在应用和通知菜单中,您可以找到已安装的应用程序列表。选择您想要限制下载的应用程序,然后点击它。在应用程序...

电脑软件开机自启动怎么设置

1、首先找到自己华硕笔记本,然后把笔记本翻开,可以看到键盘的这一面,右上角有一个比较大的按钮(不同型号不一样),然后点击一下即可成功开机。2、点击开机按钮之后,可以看到笔记本的桌面出现了一个华硕log...

手机双系统怎么切换(oppo手机双系统怎么切换)

realmeQ3有系统分身功能打开设置,直接到搜索栏搜索系统分身并开启,就可以开启系统分身功能了,设置系统分身时会请用户另外设置一个不同于主系统的密码,锁屏后解锁时输入主系统密码进入主系统,输入分身...

ie10浏览器官网入口(ie8_11浏览器官网)

在Windows10系统中,您可以按照以下步骤找到InternetExplorer(IE)浏览器:1.点击左下角的“开始”按钮。2.在弹出的菜单中,选择“设置”。3.在“系统”选项卡中,...

win10安装版非ghost(u盘安装win10非ghost)

建议不要在DOS环境下进行分区,这样的技术其实已经很久没有更新了,比如盘符显示乱码等等等等。建议进入PE环境进行分区操作,这样在引导错误时能够有专门的工具修复。我在此强力建议不要使用GHOST系统,虽...

win10关闭自动更新方法联想(联想笔记本关闭win10自动更新)

方法一鼠标单击左下角的开始菜单,选择设置;点击更新和安全;在默认界面,点击右侧的高级选项;将更新选项与更新通知下的所有选项关闭即可。方法二鼠标右键单击此电脑,选择管理;进入计算机管理界面,点击展开“服...

改wifi密码的网址(wifi改密码网站)

WiFi官方密码忘记了,用手机修改的话需要有相关的软件账号的登录才行,否则的话是无法登录进去进行密码的修改的,此外如果这个WiFi的话不是个人的WiFi应用,而是一个区域,或者说是平台的WiFi官方...

取消回复欢迎 发表评论: