beautifulSoup4,一个超实用的python库
off999 2025-07-07 22:18 117 浏览 0 评论
一.前言
我们在学习python爬虫的时候,数据提取是一个常见的任务。我们一般使用正则表达式,lxml 等提取我们需要的数据,今天我们介绍一个新的库beautifulSoup4,使用它您可以从HTML和XML文件中提取所需的信息。
什么是beautifulsoup4?
beautifulSoup4是一个用于解析HTML和XML文档的Python库。它使提取数据变得简单,快速且可靠。它允许您使用简单的Python语法来搜索,修改和导航网页结构
二.基本用法
1.安装
pip install beautifulsoup42.导入库
from bs4 import BeautifulSoup3.创建BeautifulSoup对象
from bs4 import BeautifulSoup
import requests # 导入requests库,这个库用来发送请求
from lxml import etree # 这个用来解析html的
headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/118.0.0.0 Safari/537.36'}
# 发送请求
html_doc= requests.get('https://bing.ioliu.cn/',headers=headers)
soup = BeautifulSoup(html_doc, 'html.parser') # html_doc是我们要解析的HTML文档的字符串形式第一个参数是要解析的HTML文档的字符串形式,第二个参数是解析器的选择,常用的有'html.parser'、'lxml'和'xml'等
4.查找元素
通过BeautifulSoup对象,我们可以使用各种方法来查找网页中的特定元素。以下是一些常见的查找方法:
a.使用标签名查找元素:soup.tag_name
>>> print(soup.input)
<input name="ie" type="hidden" value="utf-8"/>b.使用类名查找元素:soup.find('class', 'class_name')
>>> print(soup.find("span",class_="tools")) # 第一个是标签名字,第二个class name
<span class="tools"><span id="mHolder"><div id="mCon"><span>
输入法</span></div><ul id="mMenu"><li><a href="javascript:;" name="ime_hw">
手写</a></li><li><a href="javascript:;" name="ime_py">
拼音</a></li><li class="ln"></li><li><a href="javascript:;" name="ime_cl">
关闭</a></li></ul></span></span>
>>>c.使用ID查找元素:soup.find('id', 'id_name')
>>> print(soup.find("input",id = "su"))
<input class="bg s_btn" id="su" type="submit" value="百度一下"/>
>>>d.使用属性查找元素:soup.find('tag_name', {'attr_name': 'attr_value'})
>>> print(soup.find("input",{"value":'百度一下'}))
<input class="bg s_btn" id="su" type="submit" value="百度一下"/>
>>>e.使用CSS选择器查找元素:soup.select('css_selector')
>>> soup.select(".tools")
[<span class="tools"><span id="mHolder"><div id="mCon"><span>
输入法</span></div><ul id="mMenu"><li><a href="javascript:;" name="ime_hw">
手写</a></li><li><a href="javascript:;" name="ime_py">
拼音</a></li><li class="ln"></li><li><a href="javascript:;" name="ime_cl">
关闭</a></li></ul></span></span>]
>>>5.遍历元素
一旦找到了目标元素,我们可以使用遍历方法来获取元素的子节点或兄弟节点。以下是一些常见的遍历方法:
a.遍历所有子节点:for child in soup.children:
>>> d = soup.find("div",id="s-top-left")
>>> for i in d.children:
print(i)b.遍历所有兄弟节点:for sibling in soup.next_siblings:
>>> d = soup.find("div",id="s-top-left")
>>> for i in d.next_siblings:
print(i)三.常见应用场景
- 数据抓取BeautifulSoup4可以帮助我们从网页中提取所需的数据。例如,我们可以使用BeautifulSoup4来抓取新闻网站的标题和链接,或者从电商网站上提取商品的名称、价格和评论等信息。通过灵活的查找和遍历方法,我们可以轻松地获取到所需的数据。
- 网页解析除了数据抓取,BeautifulSoup4还可以用于网页解析和分析。我们可以使用BeautifulSoup4来提取网页中的文本内容、图片链接、视频链接等,并对这些内容进行进一步的处理和分析。例如,我们可以使用BeautifulSoup4来分析某个网站的文章结构和关键词分布,或者提取某个博客页面的评论内容和用户信息等。
- 数据清洗和预处理在进行数据分析和机器学习任务时,我们通常需要对原始数据进行清洗和预处理。BeautifulSoup4可以帮助我们完成这一步骤。例如,我们可以使用BeautifulSoup4来去除网页中的HTML标签和空格,或者对文本内容进行分词和去重等操作,从而得到干净和结构化的数据。
更多用法参考官方文档
https://www.crummy.com/software/BeautifulSoup/bs4/doc/相关推荐
- windows远程桌面(远程桌面app安卓版)
-
要在WindowsServer2016上开启远程桌面服务,您可以按照以下步骤操作:1.**打开服务器管理器**:您需要登录到您的WindowsServer2016系统。2.**启用远程桌面...
- 网盘app下载安装(雀云网盘app下载安装)
-
因为这时的文件只是下载到云盘里,并没有下载到手机里,而在云盘里是不能执行安装程序的,需要把云盘里的安装包,下载到手机内存里面,才可以执行安装命令。现在相当于,你的快递已经在驿站签收了,随时都可以拿回来...
- 隐藏文件夹不显示(隐藏文件夹不显示出来)
-
如果,可能是文件被删除或移动到其他位置。隐藏文件是指在文件系统中设置了隐藏属性的文件,通过更改文件夹的设置可以显示或隐藏这些文件。如果文件夹显示隐藏文件的设置已经开启,但仍然找不到文件,可能是因为文件...
- 强制修改密码软件下载(强制密码修改器)
-
1.首先找回账户密码(适用于Android设备):如果您的设备与账户关联,可以访问账户的“找回密码”功能,通过重置密码来修改锁屏密码。2.使用其他登录方式(适用于iOS设备):如果您启用了Touch...
- 苹果ipad充不进电怎么办(苹果ipad充不进去电什么原因)
-
如果你发现你的iPad不能充电,那么你这样试一下,你看是不是充电的温度太低,你给他拿到一个比较温暖的房间里去,第2个就是你换一个充电器试一试,是不是那个充电器坏了,如果还不行的话,你可以把iPad重新...
- 无法正常启动0xc000005(无法正常启动你的电脑0xc0000001)
-
如果手机下载安装的第三方应用出现问题,无法正常使用,三星手机一般建议进行以下步骤排查及处理:1.关闭重新启动该应用。2.建议将此软件卸载重新安装尝试。3.更换其他版本尝试。4.更新下手机系统版本后安装...
- 无线网登录(无线网登录入口)
-
1.打开手机浏览器,访问192.168.0.1,输入用户名和密码就可以进入路由器管理界面。2.手机wifi连接路由器信号之后,会弹出对话框,需要输入用户名和密码(有的路由器只需要密码)。3.正确的输入...
- 恢复精灵免费版(恢复精灵app软件下载)
-
一般都是收费的。建议选择正规的软件。推荐你用《安易》数据恢复软件。聊天恢复精灵不需要电脑。因为聊天恢复精灵是属于线上的应用程序,只需要在电子设备里面下载安装聊天恢复精灵软件就可以直接使用不靠谱手机数据...
- 苹果系统官网下载地址(iphone官网ios下载)
-
PP助手、同步推等手机助手都可以下载已经下架的应用,这类助手有很多,一搜一大把,而且就我知道的PP助手还能选择下载历史版本,当然也有部分应用是没在商店上架的,他们是通过企业证书公布自己的应用,需要到官...
-
- win10桌面切换(w10系统桌面切换)
-
win10桌面1和桌面2快速切换方法:1.按住win按键按键盘的【win】按键。2.再按Tab按键同时按下【tab】按键。3.点击桌面选项点击界面的桌面选项完成切换。具体方...
-
2025-12-19 23:51 off999
-
- 下载qq号安装(下载qq安装包)
-
QQ不能更新和下载,可尝试一下办法:1,使用数据线,将手机和电脑连接,然后从电脑端下载,保证你不闪退,不掉线。2,将你手机桌面的QQ图标删除,彻底删除.从AppStore里下载.注:在你不联机的状态下,你可能用别的助手会闪退问题,推荐从...
-
2025-12-19 23:03 off999
- 笔记本电脑上网卡多少钱一个月
-
收费有好几种!1.按流量收费,这适合不怎么上网看电影,下载的人.(想用就用,而且价格便宜)2.按小时收费,用电脑的无线连移动的无线,那有说明。(10元40小时/每月,20元100小时/每月等等,还是手...
- 一键重装系统后一直黑屏(电脑一键重装系统后黑屏)
-
黑屏故障一般有四种情况:一,全黑。主机、显示器(包括指示灯)均不亮二,显示器的指示灯亮,主机的指示灯不亮三,显示器与主机的指示灯均亮且开关电源冷却风扇也正常旋转,但显示器不显示。四,动态黑屏,开机时显...
欢迎 你 发表评论:
- 一周热门
-
-
抖音上好看的小姐姐,Python给你都下载了
-
全网最简单易懂!495页Python漫画教程,高清PDF版免费下载
-
Python 3.14 的 UUIDv6/v7/v8 上新,别再用 uuid4 () 啦!
-
飞牛NAS部署TVGate Docker项目,实现内网一键转发、代理、jx
-
python入门到脱坑 输入与输出—str()函数
-
宝塔面板如何添加免费waf防火墙?(宝塔面板开启https)
-
Python三目运算基础与进阶_python三目运算符判断三个变量
-
(新版)Python 分布式爬虫与 JS 逆向进阶实战吾爱分享
-
失业程序员复习python笔记——条件与循环
-
系统u盘安装(win11系统u盘安装)
-
- 最近发表
- 标签列表
-
- python计时 (73)
- python安装路径 (56)
- python类型转换 (93)
- python进度条 (67)
- python吧 (67)
- python的for循环 (65)
- python格式化字符串 (61)
- python静态方法 (57)
- python列表切片 (59)
- python面向对象编程 (60)
- python 代码加密 (65)
- python串口编程 (77)
- python封装 (57)
- python写入txt (66)
- python读取文件夹下所有文件 (59)
- python操作mysql数据库 (66)
- python获取列表的长度 (64)
- python接口 (63)
- python调用函数 (57)
- python多态 (60)
- python匿名函数 (59)
- python打印九九乘法表 (65)
- python赋值 (62)
- python异常 (69)
- python元祖 (57)
