百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术资源 > 正文

数据量太大?散点图装不下怎么办?用Python解决数据密度过大难题

off999 2024-11-24 20:06 30 浏览 0 评论

当我们需要观察比较2个变量间的关系时,散点图是我们首选图表。

可当数据量非常大,数据点又比较集中在某个区间中,图表没法看,密密麻麻的怎么看?


怎么办?这时候就得看密度图了

什么是密度图?

所谓的密度图 (Density Plot) 就是数据的分布稠密情况,它常用于显示数据在连续时间段内的分布状况。严格来说,它是由直方图演变而来,类似于把直方图进行了填充。

一般是使用平滑曲线来绘制数值水平来观察分布,峰值数值位置是该时间段内最高度集中的地方。

它比直方图适用性更强,不受分组数量(直方图的条形数量不宜过多)的影响,能更好地界定分布形状

本篇文章不谈论直方图,之后老海会专门总结关于直方图的使用。

什么是2D密度图?

说完了密度图和直方图,它们都是一维数据变量。

这下我们来看看2D密度图,它显示了数据集中两个定量变量范围内值的分布,有助于避免在散点图中过度绘制。

如果点太多,则2D密度图会计算2D空间特定区域内的观察次数。

该特定区域可以是正方形或六边形(六边形),还可以估算2D内核密度估算值,并用轮廓表示它。

本篇文章主要描述一下2D密度图的使用。

2D密度图的基本数据样式

2D密度图的使用建议

  • 密度图是一种直方图的代替方案,常用来观察连续变量的分布情况
  • 2D密度图主要用来解决数据点密度过大的问题,要注意密度分割是否合理。
  • 当数据范围都非常集中,数据间变化不大时,密度图往往很难观察效果。

下面开始具体的操作案例

准备工作

还是和之前一样,引入必要的工具包

## 初始字体设置,设置好可避免很多麻烦
plt.rcParams['font.sans-serif']=['Source Han Sans CN']      # 显示中文不乱码,思源黑体 
plt.rcParams['font.size'] = 22                              # 设置图表全局字体大小,后期某个元素的字体大小可以自行调整
plt.rcParams['axes.unicode_minus'] = False                  # 显示负数不乱码
## 初始化图表大小
plt.rcParams['figure.figsize'] = (20.0, 8.0)                # 设置figure_size尺寸
## 初始化图表分辨率质量
plt.rcParams['savefig.dpi'] = 300                           # 设置图表保存时的像素分辨率
plt.rcParams['figure.dpi'] = 300                            # 设置图表绘制时的像素分辨率

## 图表的颜色自定义
colors = ['#dc2624', '#2b4750', '#45a0a2', '#e87a59',
         '#7dcaa9', '#649E7D', '#dc8018', '#C89F91', 
         '#6c6d6c', '#4f6268', '#c7cccf']
plt.rcParams['axes.prop_cycle'] = plt.cycler( color=colors)

path = 'D:\\系列文章\\'
# 自定义文件路径,可以自行设定
os.chdir(path)
# 设置为该路径为工作路径,一般存放数据源文件

设定图表样式和文件路径

Financial_data = pd.read_excel('虚拟演示案例数据.xlsx',sheet_name='二维表')
Financial_data

读入数据

Financial_data = pd.read_excel('虚拟演示案例数据.xlsx',sheet_name='二维表')
Financial_data

常见的6种密度图表类型


from scipy.stats import kde  # 引入核密度计算方法


# 为方便演示,创建6个子图的画板
fig, axes = plt.subplots(3,2, figsize=(20, 20))

# 第一个子图,我们来画一个基本的散点图
# 散点图是最经典的观察2个变量关系,但数据量非常大就会出数据点堆叠交错,当值我们无法进一步探索
axes[0][0].set_title('散点图')                                           # 设置标题
axes_0 = axes[0][0].plot(Financial_data['材料'], Financial_data['管理'], 'ko')    # 画出散点图



# 第二个子图,我们画出六边形蜂巢图
# 当寻找2个数值型变量的关系,数据量很大且不希望数据堆叠在一起,就可以按照蜂巢形状切割数据点,计算每个六边形里的点数来表达密度
num_bins = 50                                                      # 设置六边形包含的距离
axes[0][1].set_title('蜂巢六边形图')                                # 设置标题
axes_1= axes[0][1].hexbin(Financial_data['材料'], Financial_data['管理'], 
                  gridsize=num_bins,                               # 设置六边形的大小
                  cmap="Blues"                                     # 设置颜色组合
                 )

fig.colorbar(axes_1,ax=axes[0][1])                                 # 设置颜色显示条

# 第三个子图,我们画出2D直方图。
# 我们您需要分析两个数据量比较大的数值变量关系时,2D直方图非常有用,它可以避免在散点图中出现的的数据密度过大问题
num_bins = 50
axes[1][0].set_title('2D 直方图')
axes_2 = axes[1][0].hist2d(Financial_data['材料'], Financial_data['管理'], 
                  bins=(num_bins,num_bins), 
                  cmap="Blues")

# fig.colorbar(axes_2,ax=axes[1][0])

 
# 第四个子图,我们画出高斯核密度图
# 考虑到想研究具有很多点的两个数值变量之间的关系。可以考虑绘图区域每个部分上的点数,来计算2D内核密度估计值。
# 就像平滑的直方图,这个方法不会使某个点掉入特定的容器中,而是会增加周围容器的权重,比如颜色会加深。
k = kde.gaussian_kde(Financial_data.loc[:,['材料','管理']].values.T)           # 进行核密度计算
xi, yi = np.mgrid[Financial_data['材料'].min():Financial_data['材料'].max():num_bins*1j, Financial_data['管理'].min():Financial_data['管理'].max():num_bins*1j]
zi = k(np.vstack([xi.flatten(), yi.flatten()]))

axes[1][1].set_title('高斯核密度图')
axes_3 = axes[1][1].pcolormesh(xi, 
                      yi, 
                      zi.reshape(xi.shape), 
                      cmap="Blues")

fig.colorbar(axes_3,ax=axes[1][1])                                  # 设置颜色显示条

# 第五个子图,我们画出带阴影效果的2D密度图
axes[2][0].set_title('带阴影效果的2D密度图')
axes[2][0].pcolormesh(xi, 
                      yi, 
                      zi.reshape(xi.shape), 
                      shading='gouraud', 
                      cmap="Blues")
 
# 第六个子图,我们画出带轮廓线的密度图
axes[2][1].set_title('带阴影+轮廓线的2D密度图')
axes_5 = axes[2][1].pcolormesh(xi, 
                      yi, 
                      zi.reshape(xi.shape), 
                      shading='gouraud', 
                      cmap="Blues")

fig.colorbar(axes_5,ax=axes[2][1])                                  # 设置颜色显示条

# 画出轮廓线
axes[2][1].contour(xi, 
                   yi, 
                   zi.reshape(xi.shape))

plt.show()

特别提一下:2D核密度估计图


sns.kdeplot(Financial_data['材料'],Financial_data['管理'])
sns.despine() # 默认无参数状态,就是删除上方和右方的边框,matplotlib貌似做不到
sns.kdeplot(Financial_data['材料'],Financial_data['管理'],
            cmap="Reds", 
            shade=True,                                    # 若为True,则在kde曲线下面的区域中进行阴影处理,color控制曲线及阴影的颜色
            shade_lowest=True,                        # 如果为True,则屏蔽双变量KDE图的最低轮廓。
#             bw=.15
           )
sns.despine() # 默认无参数状态,就是删除上方和右方的边框,matplotlib貌似做不到

写在最后

之前介绍了散点图、热力图,这次的2D密度图,也是观察数据分布的好图表

它同样符合图表演变原则,符合直方图→1D密度图→2D密度图的变化过程

在解决数据点密度大,造成数据堆叠无法观察的问题上,密度图非常有用。

OK,今天先到这里了,老海日常随笔总结,码字不易,初心不改!

如果觉得喜欢,请动动小手关注和转发,鼓励一下我们。

我是老海,来自数据炼金术师

相关推荐

安全教育登录入口平台(安全教育登录入口平台官网)

122交通安全教育怎么登录:122交通网的注册方法是首先登录网址http://www.122.cn/,接着打开网页后,点击右上角的“个人登录”;其次进入邮箱注册,然后进入到注册页面,输入相关信息即可完...

大鱼吃小鱼经典版(大鱼吃小鱼经典版(经典版)官方版)

大鱼吃小鱼小鱼吃虾是于谦跟郭麒麟的《我的棒儿呢?》郭德纲说于思洋郭麒麟作诗的相声,最后郭麒麟做了一首,师傅躺在师母身上大鱼吃小鱼小鱼吃虾虾吃水水落石出师傅压师娘师娘压床床压地地动山摇。...

谷歌地球下载高清卫星地图(谷歌地球地图下载器)
  • 谷歌地球下载高清卫星地图(谷歌地球地图下载器)
  • 谷歌地球下载高清卫星地图(谷歌地球地图下载器)
  • 谷歌地球下载高清卫星地图(谷歌地球地图下载器)
  • 谷歌地球下载高清卫星地图(谷歌地球地图下载器)
哪个软件可以免费pdf转ppt(免费的pdf转ppt软件哪个好)
哪个软件可以免费pdf转ppt(免费的pdf转ppt软件哪个好)

要想将ppt免费转换为pdf的话,我们建议大家可以下一个那个wps,如果你是会员的话,可以注册为会员,这样的话,在wps里面的话,就可以免费将ppt呢转换为pdfpdf之后呢,我们就可以直接使用,不需要去直接不需要去另外保存,为什么格式转...

2026-02-04 09:03 off999

电信宽带测速官网入口(电信宽带测速官网入口app)

这个网站看看http://www.swok.cn/pcindex.jsp1.登录中国电信网上营业厅,宽带光纤,贴心服务,宽带测速2.下载第三方软件,如360等。进行在线测速进行宽带测速时,尽...

植物大战僵尸95版手机下载(植物大战僵尸95 版下载)

1可以在应用商店或者游戏平台上下载植物大战僵尸95版手机游戏。2下载教程:打开应用商店或者游戏平台,搜索“植物大战僵尸95版”,找到游戏后点击下载按钮,等待下载完成即可安装并开始游戏。3注意:确...

免费下载ppt成品的网站(ppt成品免费下载的网站有哪些)

1、Chuangkit(chuangkit.com)直达地址:chuangkit.com2、Woodo幻灯片(woodo.cn)直达链接:woodo.cn3、OfficePlus(officeplu...

2025世界杯赛程表(2025世界杯在哪个国家)

2022年卡塔尔世界杯赛程公布,全部比赛在卡塔尔境内8座球场举行,2022年,决赛阶段球队全部确定。揭幕战于当地时间11月20日19时进行,由东道主卡塔尔对阵厄瓜多尔,决赛于当地时间12月18日...

下载搜狐视频电视剧(搜狐电视剧下载安装)

搜狐视频APP下载好的视频想要导出到手机相册里方法如下1、打开手机搜狐视频软件,进入搜狐视频后我们点击右上角的“查找”,找到自已喜欢的视频。2、在“浏览器页面搜索”窗口中,输入要下载的视频的名称,然后...

pubg免费下载入口(pubg下载入口官方正版)
  • pubg免费下载入口(pubg下载入口官方正版)
  • pubg免费下载入口(pubg下载入口官方正版)
  • pubg免费下载入口(pubg下载入口官方正版)
  • pubg免费下载入口(pubg下载入口官方正版)
永久免费听歌网站(丫丫音乐网)

可以到《我爱音乐网》《好听音乐网》《一听音乐网》《YYMP3音乐网》还可以到《九天音乐网》永久免费听歌软件有酷狗音乐和天猫精灵,以前要跳舞经常要下载舞曲,我从QQ上找不到舞曲下载就从酷狗音乐上找,大多...

音乐格式转换mp3软件(音乐格式转换器免费版)

有两种方法:方法一在手机上操作:1、进入手机中的文件管理。2、在其中选择“音乐”,将显示出手机中的全部音乐。3、点击“全选”,选中所有音乐文件。4、点击屏幕右下方的省略号图标,在弹出菜单中选择“...

电子书txt下载(免费的最全的小说阅读器)

1.Z-library里面收录了近千万本电子书籍,需求量大。2.苦瓜书盘没有广告,不需要账号注册,使用起来非常简单,直接搜索预览下载即可。3.鸠摩搜书整体风格简洁清晰,书籍资源丰富。4.亚马逊图书书籍...

最好免费观看高清电影(播放免费的最好看的电影)

在目前的网上选择中,IMDb(互联网电影数据库)被认为是最全的电影网站之一。这个网站提供了各种类型的电影和电视节目的海量信息,包括剧情介绍、演员表、评价、评论等。其还提供了有关电影制作背后的详细信息,...

孤单枪手2简体中文版(孤单枪手2简体中文版官方下载)

要将《孤胆枪手2》游戏的征兵秘籍切换为中文,您可以按照以下步骤进行操作:首先,打开游戏设置选项,通常可以在游戏主菜单或游戏内部找到。然后,寻找语言选项或界面选项,点击进入。在语言选项中,选择中文作为游...

取消回复欢迎 发表评论: