百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术资源 > 正文

Python爬虫,哪些奇特的网站值得一爬!谱时网爬虫实例

off999 2024-10-13 04:16 32 浏览 0 评论

在我们学习的过程中,打开一个网站就想抓一次数据,但是并不是所有的网站都可以用一种方式抓到数据的,有的是网页结构特殊,有的是json数据包不一样,慢慢的写一些自己在抓站过程中遇到的奇特的网站,分享思路和抓取方法给大家!

工具、目标

工具:pycharm、python3.6版本

库:requests库

目标:谱时网热门图片直播页面,所有的图片信息

说明:该网站有热门图片页面,里面有活动的相关照片,按活动将所有的图片信息写入txt文档(不下载图片,是为了不对服务器造成影响)!

目标分析

首先,如上图打开主页,其它的不用管,直接点击右上角,出现选项后,点击进入热门图片直播选项(注意:有的浏览器要缩放页面,才可以看到热门图片直播的选项),进入后页面如下所示

这里我是缩放到了30%,下方呢,就是一个个的活动图片直播的页面了。随便点开一个活动,我们看看页面

看页面的图片加载这么慢,应该是动态加载的,右键查看源代码,果不其然!

没有任何的图片信息,那么我们就需要用到浏览器的页面审查工具了!我这里用的是火狐浏览器,摁F12就可以打开,然后点击网络,清除内容,刷新页面,看看它加载了什么数据进来

简单查看后,发现了2个包含有我们要的数据


一个是活动相关信息,一个是图片相关信息,都是json格式加载的,这样就简单了,请求相关url就可以获取到,这时忽然想到,如果之前的多个活动页面也是动态加载的,那么是否可以通过这种方式将所有的活动也抓到呢?来看看

这个json数据中,存在了所有的页面加载的活动信息!没有翻页。。。怪不得加载那么慢呢[手动委屈]。

代码实现

通过上述的分析,我们明白了目标数据所在的位置,那么就可以开始试着写代码了

导入requests库,然后直接请求真实网址,获得name和对应的url(真实网址在消息头中),然后构建页面中的真实网址,上面所拿到的url其实是网页的url,并不是该网页的json包所在的真实地址,怎么拿到真实地址呢?我们多拿几个获得页面的真实网址对比,不难发现它的规律

https://wx.plusx.cn/activity/live/pics?activityNo=1341537&picIndex=0&isNew=false&count=3000&ppSign=

https://wx.plusx.cn/activity/live/pics?activityNo=3321860&picIndex=0&isNew=false&count=3000&ppSign=

https://wx.plusx.cn/activity/live/pics?activityNo=1341537&picIndex=0&isNew=false&count=3000&ppSign=

https://wx.plusx.cn/activity/live/pics?activityNo=451977&picIndex=0&isNew=false&count=3000&ppSign=

对比下就发现,其实就是activityNo的值不一样而已,而这个值在上述抓到的json包里也是存在的!

构建下一页的真实请求地址,然后抓json包,获取所有图片url!至此,核心代码已经写完,将它完善一下,整体代码和效果如下:


不到1分钟,该页面全部的活动及活动图片url保存完毕,整体代码也不到20行,很简单的一个网站!如果要下载图片,可以将url全部复制到下载工具中,批量下载哦!

后记

这个网站的整体结构比较清晰,数据也很简单就获取了,而今天之所以拿这个网站来分享,是因为开始抓包的时候,自己都不敢相信,一个页面之间加载了400多张图片。。。而且看页面结构也没想到有这么简单!

总的来说,该网站比较适合新手去学习抓包获取数据,希望能帮助到大家,加油!

相关推荐

ftp手机客户端(ftp手机客户端存文件)

要想实现FTP文件传输,必须在相连的两端都装有支持FTP协议的软件,装在您的电脑上的叫FTP客户端软件,装在另一端服务器上的叫做FTP服务器端软件。  客户端FTP软件使用方法很简单,启动后首先要与...

原版xp系统镜像(原版xp系统镜像怎么设置)

msdnitellyou又可以上了,那里有。  制作需要的软件  在开始进行制作之前,我们首先需要下载几个软件,启动光盘制作工具:EasyBoot,UltraISO以及用来对制作好的ISO镜像进行测...

office2007密钥 office2016(office2007ultimate密钥)

word2016激活密钥有两种类型:永久激活码和KMS期限激活密钥。其中,永久激活密钥可以使用批量授权版永久激活密钥进行激活,如所示;而KMS期限激活密钥需要使用KMS客户端密钥进行激活,如所示。另外...

windows10系统启动盘制作(windows10启动盘制作教程)

Windows10系统更改启动磁盘的方法如下1、按快捷键Win+R,调出命令窗口2、输入msconfig,点【确定】3、在系统配置中,选择【引导】菜单4、选择要默认启动的磁盘,点【设置为默认值】,...

方正电脑怎么重装系统

购买一张系统盘,然后启动电脑,将购买的系统盘插入电脑光驱中,等待光驱读取系统盘后,点击安装系统,即可自动安装,等待安装完毕,电脑会自动重启,重新启动后,电脑的系统就安装完毕,可以使用了一、准备需要的软...

qq邮箱怎么写才正确
qq邮箱怎么写才正确

步骤/方式1一般默认的QQ邮箱格式是:QQ号码@qq.com,即QQ账号+@qq.com后缀步骤/方式2若要发送邮件,也要在对方的qq帐号末尾加上@qq.com1.每个人在注册QQ时都会有关联的一个邮箱,它的格式就是“QQ号码@qq.com...

2025-12-21 18:51 off999

电脑怎么看配置信息
电脑怎么看配置信息

要查看Windows电脑的配置信息,可以通过按下Win键+R,然后在弹出的运行对话框中输入“dxdiag”并按回车键打开DirectX诊断工具,可以查看有关处理器、内存、显卡等硬件信息。另外,还可以右键点击“此电脑”,选择“属性”来查看...

2025-12-21 18:03 off999

mpeg是什么格式(mpeg是什么格式和mp4的区别)

是视频格式,是电脑视频文件的一种,相对其它视频文件格式而言,mpeg格式占的存储空间相对比较小,那么像素也就相对比较低,图像也没有其它格式那么高清,不过一般情况下已经满足正常的使用。好多视频文件都是采...

电脑参数配置怎么选(电脑参数配置怎么选择)

1、CPU,这个主要取决于频率和二级缓存,三级缓存,核心数量。频率越高、二级缓存越大,三级缓存越大,核心越多,运行速度越快。速度越快的CPU只有三级缓存影响响应速度。2、内存,内存的存取速度取决于接口...

windows7字体(Windows7字体库在哪)

win7系统默认中文字体是微软雅黑字体1、首先我们先打开个性化2、然后我们打开“窗口颜色”3、然后我们点击“项目”里的桌面,选择“已选定的项目”4、下面就可以改字体,还有字体的颜色、大小5、然后点击“...

windows7x86是32位吗(windows7 x86)

X86不是代表操作系统,是代表的CPU的类型,如果你知道CPU的发展史就知道,个人用计算机的CPU很早的版本是从286、386、486、586、奔腾等等类型发展起来的,所以X86的代表PC的CPU的类...

固态硬盘删除后又自动恢复了

进入BIOS查看,第一启动项是不是UEFI引导,改掉它可以下载个pe,下载安装在本地磁盘里,重启进入pe工具,先给固态格式化分区,在ghost机械盘上的系统,还原到固态上。遇到这种情况一定不要在此...

win10版本回退(win10回退到以前版本)

如果你想在Windows10系统中回退到上一个版本,可以按照以下步骤进行操作:1.打开设置:点击Windows开始按钮,然后点击屏幕左侧的“设置”图标,或者使用键盘快捷键Win+I打开设置。2...

营业厅一个路由器多少钱(上门更换路由器收费吗)

移动免费装宽带活动全国都在搞,不过免费是有“门槛”的。以我所在的地区为例,只有月费在78元及以上的大流量套餐用户,才可以享受免费安装移动的宽带。月费越高,宽带的速率也越高,148元档可以安装200M的...

win10从u盘启动怎么设置(win10怎么从u盘启动电脑)

1.回到桌面。点击开始徽标,点击开始菜单左侧的设置。2.设置界面点击更新和安全。3.进入更新和安全界面,点击左侧的恢复选项。4.进入恢复界面,点击高级启动下面的立即重新启动。5.插入自己的U盘,等待...

取消回复欢迎 发表评论: