使用 Python 在 5 分钟内抓取网站数据
off999 2024-11-27 18:50 21 浏览 0 评论
行动计划
在制作我的表情机器人时,我遇到了一个很大的不便——没有公开的表情数据库! 在找了几个小时之后,我决定是时候采取主动并自己制作了。
附: 如果你碰巧找到了一个文字表情数据库,请告诉我(这样我就可以嘲笑自己浪费了多少时间)。
总体策略:
- 使用 BeautifulSoup 制作解析器
- 使此解析器避免验证码和 HTTP 错误 403
- 找到所有包含表情符号的容器
- 根据情绪将它们放入一维数组中(一个代表快乐,一个代表愤怒等等)
- 将我们所有的数组组合成一个 Pandas 数据框
- 没有剧透,但我对生成的数据框看起来多么不寻常感到非常惊讶:)
第 1 步 — 获取网站和库
表情符号以字符串形式出现,因此从 HTML 代码中检索它们应该相对容易。
这个网站有一个小技巧:
如您所见,网站每个部分的 URL 都会有所不同。 这没问题,只是需要注意的一些事情,并且会在我们的抓取过程中增加一些工作。
让我们导入库:
from urllib.request import Request, urlopen
from bs4 import BeautifulSoup as soup
现在让我们创建请求。 这将打开网页并检查其内容。 您可以放置任何您想要的浏览器,我选择了 Mozilla,因为它似乎造成的麻烦最少(澄清一下,我使用 Chrome 作为浏览器来抓取,您不需要输入实际浏览器的名称!)
url = "https://www.emoticonstext.com/flip-table.html"
req = Request(url, headers = {'User-Agent': 'Mozilla/5.0'})
webpage = urlopen(req).read()
好的,解析器时间!
page_soup = soup(webpage, 'html.parser')
第 2 步 — 检索数据
以下是该过程背后的逻辑:
- 我们获取 url 并设置我们的解析器
- 解析器将寻找一个特定的容器(在我们的例子中是 span 容器)
- 我们将收集到的数据放入一维数组中
- 我们确保数组的长度相同(这将有助于我们稍后创建数据框)
这有点拗口,让我们开始吧!
首先,获取 url 并设置解析器:
def makeArray(url):
url_add = url
req = Request(url_add, headers = {'User-Agent': 'Mozilla/5.0'})
webpage = urlopen(req).read()
page_soup = soup(webpage, 'html.parser')
containers = page_soup.findAll("span", "emoticon")
arr_name = []
for i in containers:
arr_name.append(i)
return arr_name
很好,我们为网站的 1 个部分返回了一个数组。 我将使用这个函数制作 7 个不同的数组——每种情绪 1 个。 尽管这看起来又长又难,但它只是对每种情感的前两行代码的重复!
#create the 'laughing' array
laughing_arr = makeArray("https://www.emoticonstext.com/laughing.html")
#print its length (it was 29 values long
print(len(laughing_arr))
#create the 'surprised' array
surprised_arr = makeArray("https://www.emoticonstext.com/surprised.html")
#get its length (its 45)
print(len(surprised_arr))
#trim it down to make it 29
del surprised_arr[29:45]
###### REPEAT! ######
thinking_arr = makeArray("https://www.emoticonstext.com/thinking.html")
print(len(thinking_arr))
del thinking_arr[29:43]
confused_arr = makeArray("https://www.emoticonstext.com/confused.html")
print(len(confused_arr))
del confused_arr[29:38]
depressed_arr = makeArray("https://www.emoticonstext.com/depressed.html")
print(len(depressed_arr))
del depressed_arr[29:49]
helpless_arr = makeArray("https://www.emoticonstext.com/helpless.html")
print(len(helpless_arr))
del helpless_arr[29:35]
scared_arr = makeArray("https://www.emoticonstext.com/scared.html")
print(len(scared_arr))
del scared_arr[29:46]
恭喜,你刚刚制作了很多一维数组!
第三步——制作数据框
制作数据框所需要做的就是将我们的数组作为列添加到其中。 我们将使用 Pandas 创建我们的数据框。
import pandas as pd
df = pd.DataFrame()
df['happy'] = list(laughing_arr)
df['surprised'] = list(surprised_arr)
df['thinking'] = list(thinking_arr)
df['confused'] = list(confused_arr)
df['depressed'] = list(depressed_arr)
df['helpless'] = list(helpless_arr)
df['scared'] = list(scared_arr)
df.head(29)
好吧,让我们看看我们辛勤工作的成果:
你现在可以在这个数据框上使用 Pandas 并用它做任何你喜欢的事情!
相关推荐
- Python函数参数和返回值类型:让你的代码更清晰、更健壮
-
在Python开发中,你是否遇到过这些抓狂时刻?同事写的函数参数类型全靠猜调试两小时发现传了字符串给数值计算函数重构代码时不知道函数返回的是列表还是字典今天教你两招,彻底解决类型混乱问题!让你的...
- 有公司内部竟然禁用了python开发,软件开发何去何从?
-
今天有网友在某社交平台发文:有公司内部竟然禁止了python开发!帖子没几行,评论却炸锅了。有的说“太正常,Python本就不适合做大项目”,还有的反驳“飞书全员用Python”。暂且不说这家公司...
- 写 Python 七年才发现的七件事:真正提高生产力的脚本思路
-
如果你已经用Python写了不少脚本,却总觉得代码只是“能跑”,这篇文章或许会刷新你对这门语言的认知。以下七个思路全部来自一线实战,没有花哨的概念,只有可落地的工具与习惯。它们曾帮我省下大量无意义...
- 用Python写一个A*搜索算法含注释说明
-
大家好!我是幻化意识流。今天我们用Python写一个A*搜索算法的代码,我做了注释说明,欢迎大家一起学习:importheapq#定义搜索节点类,包括当前状态、从初始状态到该状态的代价g、从该状态...
- 使用python制作一个贪吃蛇游戏,并为每一句添加注释方便学习
-
今天来设计一个贪吃蛇的经典小游戏。先介绍下核心代码功能(源代码请往最后面拉):游戏功能:-四个难度等级:简单(8FPS)、中等(12FPS)、困难(18FPS)、专家(25FPS)-美...
- Python 之父 Guido van Rossum 宣布退休
-
Python之父GuidovanRossum在推特公布了自己从Dropbox公司离职的消息,并表示已经退休。他还提到自己在Dropbox担任工程师期间学到了很多东西——Python的类型注解(T...
- 4 个早该掌握的 Python 类型注解技巧
-
在Python的开发过程中,类型注解常常被忽视。但当面对一段缺乏类型提示、逻辑复杂的代码时,理解和维护成本会迅速上升,极易陷入“阅读地狱”。本文整理了4个关于Python类型注解的重要技巧...
- 让你的Python代码更易读:7个提升函数可读性的实用技巧
-
如果你正在阅读这篇文章,很可能你已经用Python编程有一段时间了。今天,让我们聊聊可以提升你编程水平的一件事:编写易读的函数。请想一想:我们花在阅读代码上的时间大约是写代码的10倍。所以,每当你创建...
- Python异常模块和包
-
异常当检测到一个错误时,Python解释器就无法继续执行了,反而出现了一些错误的提示,这就是所谓的“异常”,也就是我们常说的BUG例如:以`r`方式打开一个不存在的文件。f=open('...
- 别再被 return 坑了!一文吃透 Python return 语句常见错误与调试方法
-
Pythonreturn语句常见错误与调试方法(结构化详解)一.语法错误:遗漏return或返回值类型错误错误场景pythondefadd(a,b):print(a+b)...
- Python数据校验不再难:Pydantic库的工程化实践指南
-
在FastAPI框架横扫Python后端开发领域的今天,其默认集成的Pydantic库正成为处理数据验证的黄金标准。这个看似简单的库究竟隐藏着哪些让开发者爱不释手的能力?本文将通过真实项目案例,带您解...
- python防诈骗的脚本带注释信息
-
以下是一个简单但功能完整的防诈骗脚本,包含URL检测、文本分析和风险评估功能。代码结构清晰,带有详细注释,适合作为个人或家庭防诈骗工具使用。这个脚本具有以下功能:文本诈骗风险分析:检测常见诈骗关键...
- Python判断语句
-
布尔类型和比较运算符布尔类型的定义:布尔类型只有两个值:True和False可以通过定义变量存储布尔类型数据:变量名称=布尔类型值(True/False)布尔类型不仅可以自行定义,同时也可通过...
- 使用python编写俄罗斯方块小游戏并为每一句添加注释,方便学习
-
先看下学习指导#俄罗斯方块游戏开发-Python学习指导##项目概述这个俄罗斯方块游戏是一个完整的Python项目,涵盖了以下重要的编程概念:-面向对象编程(OOP)-游戏开发基础-数据...
- Python十大技巧:不掌握这些,你可能一直在做无用功!
-
在编程的世界里,掌握一门语言只是起点,如何写出优雅、高效的代码才是真功夫。Python作为最受欢迎的编程语言之一,拥有简洁明了的语法,但要想真正精通这门语言,还需要掌握一些实用的高级技巧。一、列表推导...
你 发表评论:
欢迎- 一周热门
- 最近发表
- 标签列表
-
- python计时 (73)
- python安装路径 (56)
- python类型转换 (93)
- python进度条 (67)
- python吧 (67)
- python的for循环 (65)
- python格式化字符串 (61)
- python静态方法 (57)
- python列表切片 (59)
- python面向对象编程 (60)
- python 代码加密 (65)
- python串口编程 (77)
- python封装 (57)
- python读取文件夹下所有文件 (59)
- java调用python脚本 (56)
- python操作mysql数据库 (66)
- python获取列表的长度 (64)
- python接口 (63)
- python调用函数 (57)
- python多态 (60)
- python匿名函数 (59)
- python打印九九乘法表 (65)
- python赋值 (62)
- python异常 (69)
- python元祖 (57)