python爬虫20 | 小帅b教你如何识别图片验证码
off999 2024-10-23 12:52 25 浏览 0 评论
当你在爬取某些网站的时候
对于你的一些频繁请求
对方会阻碍你
常见的方式就是使用验证码
验证码的主要功能
就是区分你是人还是鬼(机器人)
人
想法设法的搞一些手段来对付技术
而
技术又能对付人们的想法
一来一去
就有了各种各样的变态验证码
也有了各种各样的应对方式
常见的验证码有这么几种
图像验证
语音验证
短信验证
极验验证
点击验证
今天
小帅b想跟你先说说如何识别图像验证码
那么
接下来就是
学习 python 的正确姿势
我们来看看这些图片验证码
(此图来源网络)
可以发现
这些验证码大多是数字和字母组成
然后在此之上再添加一些像毛一样的线
或者搞一些噪点
或者把这些字符扭曲一下
为了增加识别难度也是辛苦人家了
接下来我们思考一下
我们要识别这类验证码要怎么做呢
首先要处理一下验证码图片
什么噪点乱七八糟的
我们尽量把它们去掉
让图片
尽量黑白
尽量只剩下字符本身
然后再用 python 强大的 OCR 工具
Python-tesseract
来识别我们优化好的图片
这样正确率就会大大的提高
哎呀
我真是个聪明 boy 啊
为了让你更清楚的知道怎么识别图像验证码
小帅b用 python 搞了几张识别难度不同的验证码
第一张
难度系数:
第二张
难度系数:
第三张
难度系数:
第四张
难度系数:
第五张
难度系数 :
先对第一张进行识别
这张看起来没什么 "污染"
所以相对简单
先安装一下 pytesseract
pip install pytesseract
接着安装一下 tesseract-ocr
如果你是 ubuntu 系统可以直接使用如下命令安装
sudo apt install tesseract-ocr
如果你是 win 系统自行 Google 一下安装 tesseract-ocr 以及环境变量配置
完了之后就导入相关模块到我们的代码文件中
try: from PIL import Imageexcept ImportError: import Imageimport pytesseract
接着我们就打开第一张图片
使用 pytesseract 识别
打印一下
captcha = Image.open("captcha1.png")result = pytesseract.image_to_string(captcha)print(result)
打印结果
ok,么有问题
接着我们来识别第 2 张
captcha = Image.open("claptcha2.png")result = pytesseract.image_to_string(captcha)print(result)
结果打印出来是
1924??
这就说明
pytesseract 是没办法识别太多噪点的图片的
如果这个图片再加上一点彩色背景
那么对 pytesseract 来说更是有点吃力的
所以我们先对这张图片灰度处理一下
captcha = Image.open("captcha2.png")result = captcha.convert('L')result.show()
图片就变成灰了
虽然灰了
但是还不够
我们除了处理灰度还需要对其 二值化
def convert_img(img,threshold): img = img.convert("L") # 处理灰度 pixels = img.load() for x in range(img.width): for y in range(img.height): if pixels[x, y] > threshold: pixels[x, y] = 255 else: pixels[x, y] = 0 return img
调用一下
convert_img(captcha,150)
这时候图片就变成这样了
是不是一下子就清晰很多了呢
这时候我们对这张图片识别一下
# 识别一下result = pytesseract.image_to_string(result)print(result)
成功识别
接下来我们再来看看有毛有噪的图片
这时候直接去识别是识别不出来的
所以还是老办法
先处理灰度
再 二值化
这次我们再降一下噪
data = img.getdata() w,h = img.size count = 0 for x in range(1,h-1): for y in range(1, h - 1): # 找出各个像素方向 mid_pixel = data[w * y + x] if mid_pixel == 0: top_pixel = data[w * (y - 1) + x] left_pixel = data[w * y + (x - 1)] down_pixel = data[w * (y + 1) + x] right_pixel = data[w * y + (x + 1)]
if top_pixel == 0: count += 1 if left_pixel == 0: count += 1 if down_pixel == 0: count += 1 if right_pixel == 0: count += 1 if count > 4: img.putpixel((x, y), 0)
图片变成这样了
再识别一下
不过
pytesseract 不是万能的
对于稍微复杂一点的就识别不出来了
至于这张
你能看出它是 1l1l0oO0 么?
如果你能
算你牛逼
反正小帅b不能
所以 pytesseract 也不能
对于一些简单的验证码
使用 pytesseract 还是可以的
如果你想提高 pytesseract 识别率
还可以去搞些图片去训练一下 tesseract-ocr
ok
以上
主要让你了解一下图片识别库的使用
以及对一些图片的常用降噪操作
那么下次你爬到一些需要图像的简单验证码
应该不在话下了
完
下回见
peace
点个赞啊~~(破音)
相关推荐
- 第九章:Python文件操作与输入输出
-
9.1文件的基本操作9.1.1打开文件理论知识:在Python中,使用open()函数来打开文件。open()函数接受两个主要参数:文件名和打开模式。打开模式决定了文件如何被使用,常见的模式有:&...
- Python的文件处理
-
一、文件处理的流程1.打开文件,得到文件句柄并赋值给一个变量2.通过句柄对文件进行操作3.关闭文件示例:d=open('abc')data1=d.read()pri...
- Python处理文本的25个经典操作
-
Python处理文本的优势主要体现在其简洁性、功能强大和灵活性。具体来说,Python提供了丰富的库和工具,使得对文件的读写、处理变得轻而易举。简洁的文件操作接口Python通过内置的open()函数...
- Python学不会来打我(84)python复制文件操作总结
-
上一篇文章我们分享了python读写文件的操作,主要用到了open()、read()、write()等方法。这一次是在文件读写的基础之上,我们分享文件的复制。#python##python自学##...
- python 文件操作
-
1.检查目录/文件使用exists()方法来检查是否存在特定路径。如果存在,返回True;如果不存在,则返回False。此功能在os和pathlib模块中均可用,各自的用法如下。#os模块中e...
- 《文件操作(读写文件)》
-
一、文件操作基础1.open()函数核心语法file=open("filename.txt",mode="r",encoding="utf-8"...
- 栋察宇宙(二十一):Python 文件操作全解析
-
分享乐趣,传播快乐,增长见识,留下美好。亲爱的您,这里是LearingYard学苑!今天小编为大家带来“Python文件操作全解析”欢迎您的访问!Sharethefun,spreadthe...
- 值得学习练手的70个Python项目(附代码),太实用了
-
Python丰富的开发生态是它的一大优势,各种第三方库、框架和代码,都是前人造好的“轮子”,能够完成很多操作,让你的开发事半功倍。下面就给大家介绍70个通过Python构建的项目,以此来学习Pytho...
- python图形化编程:猜数字的游戏
-
importrandomnum=random.randint(1,500)running=Truetimes=0##总的次数fromtkinterimport*##导入所有tki...
- 一文讲清Python Flask的Web编程知识
-
刚入坑Python做Web开发的新手,还在被配置臃肿、启动繁琐折磨?Flask这轻量级框架最近又火出圈,凭5行代码启动Web服务的极致简洁,让90后程序员小张直呼真香——毕竟他刚用这招把部署时间从半小...
- 用python 编写一个hello,world
-
第一种:交互式运行一个hello,world程序:这是写python的第一步,也是学习各类语言的第一步,就是用这种语言写一个hello,world程序.第一步,打开命令行窗口,输入python,第二步...
- python编程:如何使用python代码绘制出哪些常见的机器学习图像?
-
专栏推荐绘图的变量单变量查看单变量最方便的无疑是displot()函数,默认绘制一个直方图,并你核密度估计(KDE)sns.set(color_codes=True)np.random.seed(su...
- 如何编写快速且更惯用的 Python 代码
-
Python因其可读性而受到称赞。这使它成为一种很好的第一语言,也是脚本和原型设计的流行选择。在这篇文章中,我们将研究一些可以使您的Python代码更具可读性和惯用性的技术。我不仅仅是pyt...
- Python函数式编程的详细分析(代码示例)
-
本篇文章给大家带来的内容是关于Python函数式编程的详细分析(代码示例),有一定的参考价值,有需要的朋友可以参考一下,希望对你有所帮助。FunctionalProgramming,函数式编程。Py...
- 编程小白学做题:Python 的经典编程题及详解,附代码和注释(七)
-
适合Python3+的6道编程练习题(附详解)1.检查字符串是否以指定子串开头题目描述:判断字符串是否以给定子串开头(如"helloworld"以"hello&...
你 发表评论:
欢迎- 一周热门
- 最近发表
- 标签列表
-
- python计时 (73)
- python安装路径 (56)
- python类型转换 (93)
- python进度条 (67)
- python吧 (67)
- python的for循环 (65)
- python格式化字符串 (61)
- python静态方法 (57)
- python列表切片 (59)
- python面向对象编程 (60)
- python 代码加密 (65)
- python串口编程 (77)
- python封装 (57)
- python读取文件夹下所有文件 (59)
- java调用python脚本 (56)
- python操作mysql数据库 (66)
- python获取列表的长度 (64)
- python接口 (63)
- python调用函数 (57)
- python多态 (60)
- python匿名函数 (59)
- python打印九九乘法表 (65)
- python赋值 (62)
- python异常 (69)
- python元祖 (57)