[Python数据采集]超越 Selenium:探索 Playwright 的强大自动化功能
off999 2024-12-16 15:21 16 浏览 0 评论
Playwright 提供了非常灵活且丰富的 API,使得用户可以轻松实现浏览器自动化任务。接下来,我将详细介绍一些 Playwright 中常见的语法和参数,并结合实际的 Python 代码举例说明这些 API 的使用方法和技巧。
1.Browser Launch (启动浏览器)
Playwright 支持启动多种浏览器:Chromium、Firefox 和 WebKit。我们可以通过指定参数来控制浏览器的行为。
from playwright.sync_api import sync_playwright
with sync_playwright() as p:
# 启动 Chromium 浏览器,无头模式(默认值为 True 表示无头模式)
browser = p.chromium.launch(headless=False, slow_mo=50)
# 打开一个新的页面
page = browser.new_page()
page.goto('https://example.com')
# 打印页面标题
print(page.title())
# 关闭浏览器
browser.close()
)
常见参数:
- headless: 控制是否无头模式(即不显示浏览器窗口),默认是 True。
- slow_mo: 设置浏览器动作的延迟,单位为毫秒。可以用于调试时观察自动化操作。
- args: 可以传递启动浏览器时的命令行参数,例如设置代理、窗口大小等。
browser = p.chromium.launch(headless=False, args=['--window-size=1280,720'])
2.New Context (创建新浏览器上下文)
每个浏览器上下文(BrowserContext)是独立的,可以用来隔离不同的会话、Cookie、缓存等信息。
with sync_playwright() as p:
browser = p.chromium.launch(headless=False)
# 创建一个新的浏览器上下文(可以模拟不同的用户会话)
context = browser.new_context(
viewport={'width': 1280, 'height': 720},
locale='en-US',
user_agent="MyCrawler"
)
page = context.new_page()
page.goto('https://example.com')
# 打印用户代理和页面标题
print(page.evaluate("navigator.userAgent"))
print(page.title())
browser.close()
)
常见参数:
- viewport: 设置页面的视口大小,通常用于模拟不同的屏幕分辨率。
- locale: 设置页面语言,模拟用户的语言环境。
- user_agent: 设置自定义的用户代理(User-Agent),通常用于防止反爬虫机制。
- geolocation: 设置地理位置(用于基于位置的内容)。
context = browser.new_context(
geolocation={'longitude': 12.4924, 'latitude': 41.8902}, # 罗马斗兽场的位置
permissions=['geolocation'] # 允许获取地理位置信息
)
3.Page Interaction (页面交互)
Playwright 支持丰富的页面交互操作,包括点击、输入文本、选择下拉框选项、上传文件等。
3.1 点击元素 (page.click)
page.goto('https://example.com/login')
# 点击登录按钮
page.click('button#login')
3.2 输入文本 (page.fill)
# 在登录页面的输入框输入用户名和密码
page.fill('input[name="username"]', 'my_username')
page.fill('input[name="password"]', 'my_password')
3.3 选择下拉框 (page.select_option)
# 选择下拉框中的一个选项
page.select_option('select#country', 'USA')
3.4 文件上传 (page.set_input_files)
# 上传文件
page.set_input_files('input[type="file"]', 'path/to/file.txt')
3.5 模拟键盘输入 (page.keyboard)
# 模拟键盘按下 Enter 键
page.keyboard.press("Enter")
3.6 滚动页面 (page.evaluate)
# 滚动页面到底部
page.evaluate("window.scrollTo(0, document.body.scrollHeight)")
4.Waiting for Elements (等待元素)
Playwright 提供了自动等待元素出现或加载的机制,使得操作更加可靠,减少了手动使用 sleep 的需求。
# 等待按钮出现并点击
page.wait_for_selector('button#submit', state='visible')
page.click('button#submit')
常见的等待方法:
- wait_for_selector: 等待指定选择器的元素出现、可见或被移除。可以通过 state 参数设置等待条件。
- wait_for_load_state: 等待页面的加载状态,可以是 load(完全加载)、domcontentloaded(DOM加载完成)或 networkidle(网络请求空闲)。
# 等待页面完全加载
page.wait_for_load_state('load')
5.Network Interception (网络拦截)
Playwright 允许拦截和修改网络请求和响应,通常用于数据采集时处理反爬虫机制或调试网络请求。
def handle_route(route, request):
# 拦截并修改请求头部
headers = request.headers.copy()
headers['X-My-Custom-Header'] = 'custom_value'
route.continue_(headers=headers)
with sync_playwright() as p:
browser = p.chromium.launch(headless=False)
page = browser.new_page()
# 设置请求拦截
page.route('**/*', handle_route)
page.goto('https://example.com')
browser.close()
6.Screenshots & Video (截图与视频录制)
Playwright 支持对页面或特定元素进行截图,甚至可以录制整个浏览过程的视频,帮助调试和测试。
截图
# 截图整个页面
page.screenshot(path='full_page.png', full_page=True)
# 只截图某个元素
element = page.locator('div#target')
element.screenshot(path='element_screenshot.png')
视频录制
context = browser.new_context(record_video_dir='videos/')
page = context.new_page()
page.goto('https://example.com')
page.screenshot(path='example.png')
# 关闭浏览器上下文后视频将保存到指定目录
context.close()
7.Cookies & Storage (Cookie与存储)
Playwright 可以获取和设置页面的 cookies,以及管理 localStorage 和 sessionStorage。
设置和获取 Cookies
# 设置 Cookie
context.add_cookies([{
'name': 'cookie_name',
'value': 'cookie_value',
'domain': 'example.com',
'path': '/',
}])
# 获取所有 Cookie
cookies = context.cookies()
print(cookies)
管理 LocalStorage
# 使用 `evaluate` 在页面上下文中操作 localStorage
page.evaluate("localStorage.setItem('key', 'value')")
value = page.evaluate("localStorage.getItem('key')")
print(value)
8.Assertions (断言)
Playwright 还内置了一些简单的断言功能,适用于自动化测试。
# 检查页面标题是否包含 "Example Domain"
assert 'Example Domain' in page.title()
# 检查按钮是否可见
assert page.is_visible('button#submit')
9.Handling Dialogs (处理对话框)
在自动化过程中,有时会遇到浏览器弹出的 alert、confirm 或 prompt 对话框,Playwright 提供了处理这些对话框的方法。
page.once("dialog", lambda dialog: dialog.accept())
page.click("button#trigger-alert")
总结
Playwright 提供了非常丰富的 API 和参数,允许用户在浏览器自动化、数据采集、测试等领域灵活应用。从启动浏览器、创建浏览器上下文、操作页面元素,到网络拦截和处理对话框,Playwright 可以帮助我们处理各种复杂的场景。
相关推荐
- 让 Python 代码飙升330倍:从入门到精通的四种性能优化实践
-
花下猫语:性能优化是每个程序员的必修课,但你是否想过,除了更换算法,还有哪些“大招”?这篇文章堪称典范,它将一个普通的函数,通过四套组合拳,硬生生把性能提升了330倍!作者不仅展示了“术”,更传授...
- 7 段不到 50 行的 Python 脚本,解决 7 个真实麻烦:代码、场景与可复制
-
“本文整理自开发者AbdurRahman在Stackademic的真实记录,所有代码均经过最小化删减,确保在50行内即可运行。每段脚本都对应一个日常场景,拿来即用,无需额外依赖。一、在朋...
- Python3.14:终于摆脱了GIL的限制
-
前言Python中最遭人诟病的设计之一就是GIL。GIL(全局解释器锁)是CPython的一个互斥锁,确保任何时刻只有一个线程可以执行Python字节码,这样可以避免多个线程同时操作内部数据结...
- Python Web开发实战:3小时从零搭建个人博客
-
一、为什么选Python做Web开发?Python在Web领域的优势很突出:o开发快:Django、Flask这些框架把常用功能都封装好了,不用重复写代码,能快速把想法变成能用的产品o需求多:行业...
- 图解Python编程:从入门到精通系列教程(附全套速查表)
-
引言本系列教程展开讲解Python编程语言,Python是一门开源免费、通用型的脚本编程语言,它上手简单,功能强大,它也是互联网最热门的编程语言之一。Python生态丰富,库(模块)极其丰富,这使...
- Python 并发编程实战:从基础到实战应用
-
并发编程是提升Python程序效率的关键技能,尤其在处理多任务场景时作用显著。本文将系统介绍Python中主流的并发实现方式,帮助你根据场景选择最优方案。一、多线程编程(threading)核...
- 吴恩达亲自授课,适合初学者的Python编程课程上线
-
吴恩达教授开新课了,还是亲自授课!今天,人工智能著名学者、斯坦福大学教授吴恩达在社交平台X上发帖介绍了一门新课程——AIPythonforBeginners,旨在从头开始讲授Python...
- Python GUI 编程:tkinter 初学者入门指南——Ttk 小部件
-
在本文中,将介绍Tkinter.ttk主题小部件,是常规Tkinter小部件的升级版本。Tkinter有两种小部件:经典小部件、主题小部件。Tkinter于1991年推出了经典小部件,...
- Python turtle模块编程实践教程
-
一、模块概述与核心概念1.1turtle模块简介定义:turtle是Python标准库中的2D绘图模块,基于Logo语言的海龟绘图理念实现。核心原理:坐标系系统:原点(0,0)位于画布中心X轴:向右...
- Python 中的asyncio 编程入门示例-1
-
Python的asyncio库是用于编写并发代码的,它使用async/await语法。它为编写异步程序提供了基础,通过非阻塞调用高效处理I/O密集型操作,适用于涉及网络连接、文件I/O...
- 30天学会Python,开启编程新世界
-
在当今这个数字化无处不在的时代,Python凭借其精炼的语法架构、卓越的性能以及多元化的应用领域,稳坐编程语言排行榜的前列。无论是投身于数据分析、人工智能的探索,还是Web开发的构建,亦或是自动化办公...
- Python基础知识(IO编程)
-
1.文件读写读写文件是Python语言最常见的IO操作。通过数据盘读写文件的功能都是由操作系统提供的,读写文件就是请求操作系统打开一个文件对象(通常称为文件描述符),然后,通过操作系统提供的接口从这个...
- Python零基础到精通,这8个入门技巧让你少走弯路,7天速通编程!
-
Python学习就像玩积木,从最基础的块开始,一步步搭建出复杂的作品。我记得刚开始学Python时也是一头雾水,走了不少弯路。现在回头看,其实掌握几个核心概念,就能快速入门这门编程语言。来聊聊怎么用最...
- 一文带你了解Python Socket 编程
-
大家好,我是皮皮。前言Socket又称为套接字,它是所有网络通信的基础。网络通信其实就是进程间的通信,Socket主要是使用IP地址,协议,端口号来标识一个进程。端口号的范围为0~65535(用户端口...
- Python-面向对象编程入门
-
面向对象编程是一种非常流行的编程范式(programmingparadigm),所谓编程范式就是程序设计的方法论,简单的说就是程序员对程序的认知和理解以及他们编写代码的方式。类和对象面向对象编程:把...
你 发表评论:
欢迎- 一周热门
- 最近发表
- 标签列表
-
- python计时 (73)
- python安装路径 (56)
- python类型转换 (93)
- python进度条 (67)
- python吧 (67)
- python的for循环 (65)
- python格式化字符串 (61)
- python静态方法 (57)
- python列表切片 (59)
- python面向对象编程 (60)
- python 代码加密 (65)
- python串口编程 (77)
- python封装 (57)
- python写入txt (66)
- python读取文件夹下所有文件 (59)
- python操作mysql数据库 (66)
- python获取列表的长度 (64)
- python接口 (63)
- python调用函数 (57)
- python多态 (60)
- python匿名函数 (59)
- python打印九九乘法表 (65)
- python赋值 (62)
- python异常 (69)
- python元祖 (57)