Python案例:一个房地产网站数据采集及简单可视化分析
off999 2024-12-16 15:20 12 浏览 0 评论
这次分享一个房地产网站数据采集及可视化分析的Python实际案例,应用效果还是有,步骤如下:
1、获取目标网站
2、分析网站,确定数据采集的方法
3、对采集的数据进行处理
4、最后可视化
先看看最终效果:
首先获取目标网站,可以发现获取的数据信息都在网页上面,所以可以直接使用xpath标签定位获取网页上的数据,而不用担心动态网页的数据会出现变化:
然后获取各个采集字段的具体xpath,包括房源信息、房价、地区、建面(面积)等字段的xpa,部分代码如下:
fymc=n.xpath('./div/div[1]/a/text()')[0]#房源名称
fj=n.xpath('./div/div[6]/div/span[1]/text()')[0]#房价
diqu=n.xpath('./div/div[2]/span[1]/text()')[0]#地区
mj=n.xpath('./div/div[3]/span/text()')[0]
然后我们要爬取页数要设置,可以看到页数链接明显出现变化,而且还是规律性的,所以可以构造一个循环采集指定页数的信息(也就是翻页采集),部分代码如下:
for i in range(1,6):
url='https://nn.fang.lianjia.com/loupan/pg'+str(i)
#print(url)
翻页采集搞定了,接下来就是数据处理,先判断采集的数据有没有空值或者缺失值,就必须使用numpy和pandas这两个模块进行数据处理,部分代码如下:
data=pd.read_csv(r'C:/Users/Administrator/Desktop/链家数据.csv',encoding='gbk')
#data.describe()#做描述性分析,判断有没有空值或者缺失值
然后查看采集的数据发现,建面面积这个字段既有中文又有数字和特殊符号,我们要对这个字段进行拆分,拆分为最大面积和最小面积,代码如下:
data['最小面积']=data['面积'].str.split(expand=True)[1].str.split('-',expand=True)[0]
data['最大面积']=data['面积'].str.split(expand=True)[1].str.split('-',expand=True)[1].str.split('㎡',expand=True)[0]
data=data.drop('面积',axis=1)
处理完采集的数据,接下来就是对数据进行可视化,可视化就用到matplotlib这个模块,我们用了三个图去可视化数据,包括折线图、饼图、条形图,部分代码如下:
#制作可视化图表
plt.figure(figsize=(10,8))
plt.suptitle("南宁房价可视化分析",fontsize=20)
plt.subplot(2,2,1)
#不同地区的房源数量--饼图
plt.title('不同地区的房源数量占比--饼图')
explode=[0,0,0,0,0.2,0]
plt.pie(x=data.地区.value_counts(),labels=data.地区.value_counts().index,
explode=explode,autopct='%.3f%%')
plt.subplot(2,2,2)
plt.title('不同地区的房源数量--条形图')
plt.ylim(0,20)
x=data.地区.value_counts().index
y=data.地区.value_counts()
plt.bar(x=x,height=y,width=0.5)
for a,b in zip(x,y):
plt.text(a,b+0.2,str(b),ha='center',va='bottom',fontsize=10.5,color='green')
plt.subplot(2,1,2)
plt.title('不同地区平均房价——折线图')
plt.ylim(0,30000)
qingxiu=int(data[data['地区']=="青秀区"].房价.mean())
xixiangtang=int(data[data['地区']=="西乡塘区"].房价.mean())
xingning=int(data[data['地区']=="兴宁区"].房价.mean())
liangqing=int(data[data['地区']=="良庆区"].房价.mean())
yongning=int(data[data['地区']=="邕宁区"].房价.mean())
dq=['青秀区','西乡塘区','兴宁区','良庆区','邕宁区']
mean_fj=[qingxiu,xixiangtang,xingning,liangqing,yongning]
#折线图#
plt.plot(dq,mean_fj,label='不同地区平均房价')
for a,b in zip(dq,mean_fj):
plt.text(a,b+0.2,str(b),ha='center',va='top',fontsize=10.5)
plt.legend(loc=1,fontsize=13)
plt.show()
最后不多说了,附上完整代码:
import requests
from lxml import etree
import csv
import pandas as pd
import matplotlib.pyplot as plt
from pylab import mpl
import time
with open('C:/Users/Administrator/Desktop/链家数据.csv','w',encoding='gbk') as f:
f.write('房源名称,房价,地区,面积\n')
f.close()
for i in range(1,6):
url='https://nn.fang.lianjia.com/loupan/pg'+str(i)
#print(url)
headers={
'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/86.0.4240.198 Safari/537.36'
}
r=requests.get(url,headers=headers).content
b=etree.HTML(r)
c=b.xpath('/html/body/div[3]/ul[2]/li')
try:
for n in c:
fymc=n.xpath('./div/div[1]/a/text()')[0]#房源名称
fj=n.xpath('./div/div[6]/div/span[1]/text()')[0]#房价
diqu=n.xpath('./div/div[2]/span[1]/text()')[0]#地区
mj=n.xpath('./div/div[3]/span/text()')[0]
with open('C:/Users/Administrator/Desktop/链家数据.csv','a',encoding='gbk') as f1:
f1.write('{},{},{},{}\n'.format(fymc,fj,diqu,mj))
print("数据爬取成功!")
except:
pass
time.sleep(20)
mpl.rcParams['font.sans-serif']=['SimHei']
mpl.rcParams['axes.unicode_minus']=False
data=pd.read_csv(r'C:/Users/Administrator/Desktop/链家数据.csv',encoding='gbk')
#数据处理,拆分面积字段为两列数据,最小面积和最大面积
#data.describe()
data['最小面积']=data['面积'].str.split(expand=True)[1].str.split('-',expand=True)[0]
data['最大面积']=data['面积'].str.split(expand=True)[1].str.split('-',expand=True)[1].str.split('㎡',expand=True)[0]
data=data.drop('面积',axis=1)
#制作可视化图表
plt.figure(figsize=(10,8))
plt.suptitle("南宁房价可视化分析",fontsize=20)
plt.subplot(2,2,1)
#不同地区的房源数量--饼图
plt.title('不同地区的房源数量占比--饼图')
explode=[0,0,0,0,0.2,0]
plt.pie(x=data.地区.value_counts(),labels=data.地区.value_counts().index,
explode=explode,autopct='%.3f%%')
plt.subplot(2,2,2)
plt.title('不同地区的房源数量--条形图')
plt.ylim(0,20)
x=data.地区.value_counts().index
y=data.地区.value_counts()
plt.bar(x=x,height=y,width=0.5)
for a,b in zip(x,y):
plt.text(a,b+0.2,str(b),ha='center',va='bottom',fontsize=10.5,color='green')
plt.subplot(2,1,2)
plt.title('不同地区平均房价——折线图')
plt.ylim(0,30000)
qingxiu=int(data[data['地区']=="青秀区"].房价.mean())
xixiangtang=int(data[data['地区']=="西乡塘区"].房价.mean())
xingning=int(data[data['地区']=="兴宁区"].房价.mean())
liangqing=int(data[data['地区']=="良庆区"].房价.mean())
yongning=int(data[data['地区']=="邕宁区"].房价.mean())
dq=['青秀区','西乡塘区','兴宁区','良庆区','邕宁区']
mean_fj=[qingxiu,xixiangtang,xingning,liangqing,yongning]
#折线图#
plt.plot(dq,mean_fj,label='不同地区平均房价')
for a,b in zip(dq,mean_fj):
plt.text(a,b+0.2,str(b),ha='center',va='top',fontsize=10.5)
plt.legend(loc=1,fontsize=13)
plt.show()
相关推荐
- 独家 | 5 个Python高级特性让你在不知不觉中成为Python高手
-
你已经使用Python编程了一段时间,编写脚本并解决各种问题。是你的水平出色吗?你可能只是在不知不觉中利用了Python的高级特性。从闭包(closure)到上下文管理器(contextmana...
- Python装饰器
-
Python装饰器是一种用于修改函数或类的行为的特殊语法。它们允许在不修改原始代码的情况下,通过将函数或类作为参数传递给另一个函数来添加额外的功能。装饰器本质上是一个函数,它接受一个函数作为参数,并返...
- 中高阶Python常规用法--上下文管理器
-
Python以简单性和通用性著称,是一种深受全球开发人员喜爱的编程语言。它提供了大量的特性和功能,使编码成为一种愉快的体验。在这些功能中,一个经常被新手忽视的强大工具是上下文管理器。上下文管理器是高...
- Python小案例67- 装饰器
-
Python装饰器是一种用于修改函数或类的行为的特殊语法。它们允许在不修改原始代码的情况下,通过将函数或类作为参数传递给另一个函数来添加额外的功能。装饰器本质上是一个函数,它接受一个函数作为参数,并返...
- python常用的语法糖
-
概念Python的语法糖(SyntacticSugar)是指那些让代码更简洁、更易读的语法特性,它们本质上并不会增加新功能,但能让开发者更高效地编写代码。推导式写法推导式是Python最经典的...
- python - 常用的装饰器 decorator 有哪些?
-
python编程中使用装饰器(decorator)工具,可以使代码更简洁清晰,提高代码的重用性,还可以为代码维护提供方便。对于python初学者来说,根据装饰器(decorator)的字面意思并不...
- python数据缓存怎么搞 ?推荐一个三方包供你参考,非常简单好用。
-
1.数据缓存说明数据缓存可以说也是项目开发中比不可少的一个工具,像我们测试的系统中,你都会见到像Redis一样的数据缓存库。使用缓存数据库的好处不言而喻,那就是效率高,简单数据直接放在缓存中...
- 用于时间序列数据的Graphite监视工具
-
结合第三方工具,Graphite为IT性能监控提供了许多好处。本文介绍其核心组件,包括Carbon、Whisper以及安装的基本准则。Graphite监视工具可实时或按需,大规模地绘制来自多个来源的时...
- Python3+pygame实现的坦克大战
-
一、显示效果二、代码1.说明几乎所有pygame游戏,基本都遵循一定的开发流程,大体如下:初始化pygame创建窗口while循环检测以及处理事件(鼠标点击、按键等)更新UI界面2.代码创建一个m...
- Python之鸭子类型:一次搞懂with与上下文装饰器
-
引言在鸭子类型的理念的基础之上,从关注类型,转变到关注特性和行为。结合Python中的魔法函数的体系,我们可以将自定义的类型,像内置类型一样被使用。今天这篇文章中,接着该话题,继续聊一下with语法块...
- Python必会的50个代码操作
-
学习Python时,掌握一些常用的程序操作非常重要。以下是50个Python必会的程序操作,主要包括基础语法、数据结构、函数和文件操作等。1.HelloWorldprint("Hello,...
- 一文掌握Python 中的同步和异步
-
同步代码(Sync)同步就像在一个流水线上工作,每个任务都等待前一个任务完成。示例:机器A切割钢板→完成后,机器B钻孔→完成后,机器C上色。在Python中,同步代码看起来像这样:im...
- python 标注模块timeit: 测试函数的运行时间
-
在Python中,可以使用内置的timeit模块来测试函数的运行时间。timeit模块提供了一个简单的接口来测量小段代码的执行时间。以下是使用timeit测试函数运行时间的一般步骤:导入...
- Python带你找回童年的万花尺
-
还记得小时候的万花尺吧?这么画:一点也不费脑筋,就可以出来这么多丰富多彩的复杂几何图形。具体而言,可以用万花尺玩具(如图2-1所示)来绘制数学曲线。这种玩具由两个不同尺寸的塑料齿轮组成,一大一小。小的...
- Python 时间模块深度解析:从基础到高级的全面指南
-
直接上干货一、时间模块核心类介绍序号类名说明1datetime.datetime表示一个具体的日期和时间,结合了日期和时间的信息。2datetime.date表示一个具体的日期。3datetime.t...
你 发表评论:
欢迎- 一周热门
- 最近发表
- 标签列表
-
- python计时 (54)
- python安装路径 (54)
- python类型转换 (75)
- python进度条 (54)
- python的for循环 (56)
- python串口编程 (60)
- python写入txt (51)
- python读取文件夹下所有文件 (59)
- java调用python脚本 (56)
- python操作mysql数据库 (66)
- python字典增加键值对 (53)
- python获取列表的长度 (64)
- python接口 (63)
- python调用函数 (57)
- python qt (52)
- python人脸识别 (54)
- python斐波那契数列 (51)
- python多态 (60)
- python命令行参数 (53)
- python匿名函数 (59)
- python打印九九乘法表 (65)
- centos7安装python (53)
- python赋值 (62)
- python异常 (69)
- python元祖 (57)