百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术资源 > 正文

Python机器学习之全面解释决策树分类

off999 2024-11-26 07:24 37 浏览 0 评论

在本文中,决策树算法是所有其他树模型的基础模型。决策树包含在CART(分类和回归树)算法中,该算法是sklearn中的优化版本。这些是非参数监督学习。非参数表示数据是无分布的,即变量是标称或有序的。

决策树通过选择根节点进行决策,然后进一步细分为节点。拆分基于决策树中使用的度量。较早的文章是关于回归和分类的度量。但是在决策树的情况下,指标略有不同。

决策树中的指标

  1. 基尼杂质和熵
  2. 信息增益
  3. 减少方差

决策树具有几种算法,可以从数据集中生成决策树,如下所示:

  • ID3(迭代二分法3):它生成较小的树,并且对连续数据无用,因为它会导致在该属性中找到多个拆分,并且需要更长的时间。它也确实在训练集上过拟合。
  • C4.5:它是ID3的高级版本,它也可以基于阈值处理连续数据。在缺少值得数据集中也很有用。创建树木后,它也可以修剪。
  • CART:这是一个分类和回归树,根据输出变量是分类变量还是数字变量生成树。CART检测到该属性中没有进一步的增益,并停止拆分。

我们将看到不同的算法如何使用不同的度量标准来进行树的拆分。

基尼和熵

  • 该算法的CART版本中使用了基尼杂质。它用于发现对观察结果进行错误分类的可能性,并且可以使用较低的Gini值进行更好的拆分。
  • 熵还用于根据错误分类的观察结果对树木进行分割。由于需要进行日志计算,因此需要花费更长的时间。
  • 这里的主要区别是要注意,基尼的取值范围是0到0.5。熵的取值范围是0到1。
  • 该算法的ID3和C4.5版本中使用了熵。

信息增益

它与熵值一起使用。从先验状态到信息状态的熵值之差。

通常,分割是基于最大增益或从目标变量到另一个属性的信息来完成的。

增益(i)=信息增益(Y)-熵(Ai)

Y —因变量

Ai-自变量的属性(i = 1,2…n)

减少方差

这在回归问题中很有用,因为当输出变量为连续数时,节点的分割基于方差值。

现在是时候对分类问题使用python进行实际操作了。

import numpy as np
import matplotlib.pyplot as plt
import pandas as pd

导入库之后的下一步,我们现在将读取CSV文件并将数据分为特征和目标变量。

dataset = pd.read_csv('Social_Network_Ads.csv')
x_set_values = dataset.iloc[:, [2, 3]].values
y_set_values = dataset.iloc[:, 4].values

现在将数据分为训练和测试数据。

from sklearn.model_selection import train_test_split
X_train, X_test, y_train, y_test = train_test_split(x_set_values,
                y_set_values, test_size = 0.25, random_state = 0)

在下一步中,我们可以进行标准缩放,但是我认为在决策树中不应该这样做,因为拆分应该基于实际值而不是基于缩放值。但是,如果缩放部分如下所示:

from sklearn.preprocessing import StandardScaler
sc = StandardScaler()
X_train = sc.fit_transform(X_train)
X_test = sc.transform(X_test)

在此算法中,我们将使用熵

#件分类器分类训练集
from sklearn.tree import DecisionTreeClassifier
classifier = DecisionTreeClassifier(criterion = 'entropy', random_state= 0)
classifier.fit(X_train, y_train)
#output:
DecisionTreeClassifier(class_weight=None, criterion='entropy',
            max_depth=None,
            max_features=None, max_leaf_nodes=None,
            min_impurity_decrease=0.0, min_impurity_split=None,
            min_samples_leaf=1, min_samples_split=2,
            min_weight_fraction_leaf=0.0, presort=False,
            random_state=0,splitter='best')

现在,我们将预测数据并建立模型。

#预测测试集结果
y_pred = classifier.predict(X_test)

现在,我们计算混淆矩阵。


from sklearn.metrics import confusion_matrix
cm = confusion_matrix(y_test, y_pred)


array([[66,  2],
              [ 8, 24]], dtype=int64)

使用Entropy可视化训练和测试结果。

from matplotlib.colors import ListedColormap
X_set, y_set = X_train, y_train
X1, X2 = np.meshgrid(np.arange(start = X_set[:, 0].min() - 1, stop =
                     X_set[:, 0].max() + 1, step = 0.01),
                     np.arange(start = X_set[:, 1].min() - 1, stop = 
                     X_set[:, 1].max() + 1, step = 0.01))
plt.contourf(X1, X2, classifier.predict(np.array([X1.ravel(), 
             X2.ravel()]).T).reshape(X1.shape),
             alpha = 0.5, cmap = ListedColormap(('red', 'green')))
plt.xlim(X1.min(), X1.max())
plt.ylim(X2.min(), X2.max())
for i, j in enumerate(np.unique(y_set)):
    plt.scatter(X_set[y_set == j, 0], X_set[y_set == j, 1],
                alpha=0.5,
                c = ListedColormap(('red', 'green'))(i), label = j)
plt.title('Decision Tree (Training set)')
plt.xlabel('Age')
plt.ylabel('Estimated Salary')
plt.legend()
plt.show()

将标准更改为“ Gini”后,不会更改混淆矩阵值。

这些是训练集上带有熵和Gini的树分裂分离准则。我们观察到图中有很好的分类。

结论:

决策树在分类和回归中非常有用。标准参数给出数据集的不同树拆分。

相关推荐

win7系统破解激活工具(windows7破解激活)

方法如下:1、开机到欢迎界面时,按Ctrl+Alt+Delete,跳出帐号窗口,输入用户名:administrator,回车。2、如果这个帐号也有密码采用开机启动时按F8选“带命令行的安全模式”。...

怎么制作winpeu盘启动盘(制作winpe启动盘有什么作用)

我们应先理解U盘启动盘:简单理解就是用U盘启动盘代替电脑以前的光驱,所以它只有3个最基本的功能:1、帮助电脑正常启动。比如电脑无限在启动界面循环;2、格式化硬盘。格式化硬盘所有分区,再重新分区;3、重...

磁力搜索引擎入口(磁力搜索器引擎)

01.磁力熊磁力熊,是一个内容丰富、功能最为强大的一个磁力搜索网站,通过它不仅仅可以搜索到大量纯净的1080P高分电影,像一些比较小众的影视剧这里也都能找到。02.夕阳小站夕阳小站,虽然网站整体界面设...

手机变成安全模式怎么解除(手机变成安全模式是怎么回事)

解除比较安全模式的方法主要有三种:1、按电源键长按机器会弹出重启菜单,将手机重启即可解除比较安全模式。2、查询手机操作手册,进入设置里找到“比较安全模式”,可以改变比较安全模式的状态,即可解除比较安全...

win7官方最小精简版(最小win7精简版系统239m)
win7官方最小精简版(最小win7精简版系统239m)

推荐win7系统精简版一、雨林木风系统v1906雨林雨林木风GhostWin7SP1旗舰版一如既往注重稳定与安全,本次6月版本更新优化注册表增强系统运行效率,不对系统关键文件进行修改保证稳定性,关闭系统可能会感染病毒的端口,更新最新...

2026-01-11 14:51 off999

华硕牌子电脑怎么样(华硕牌子电脑怎么样值得买吗)

1、华硕笔记本电脑在市场上有很高的认知度和认可度。除了在零售市场有出色口碑外,在特殊领域华硕笔记本一样有惊人的表现;2、华硕笔记本电脑的优点在于它的主板性能好还有就是它的散热效果也不错,性能比较稳定;...

两个文件夹内容自动同步(两个文件夹内容自动同步,删除不了)

D:盘中点右键,新建公文包B,将文件夹A拖到公文包B中。如果以后文件夹A中的文件修改了,打开公文包B,点菜单上的“公文包、全部更新”。则公文包B就会自动更新文件,与文件夹A中的保持一致。这种方法可以有...

无法删除的文件夹怎么删(无法删除文件夹或文件的原因有哪些)

删除不了的软件、文件或文件夹的解决方法:1、开机按F8不动,到高级选项出现在松开手,用上下键选安全模式,按照提示进入到安全模式中删除即可(安全模式与正常模式操作一样)。2、如果使用其他办法无法删...

win7重装系统不用u盘(不用u盘新手重装系统win7)

可以通过以下步骤在不使用U盘的情况下重装Win7系统:首先需要备份您的电脑中的重要数据,以免在系统重装时丢失。进入系统的“控制面板”,找到“系统与安全”选项并单击进入。在“系统与安全”页面中,找到“备...

扣扣安全中心怎么修改密码(扣扣安全中心修改不了密码)

1、首先,打开QQ面板左下角的三个条形图标,然后在弹出选项的“安全”中单击“安全中心主页”。2、然后在打开的QQ安全中心页面中,单击头像下方的“修改密码”。3、然后将弹出一个提示来确认该QQ号码,并单...

win10两台电脑怎么共享文件(win10两台电脑怎么共享文件夹)

在Windows10中,您可以使用以下步骤共享文件:1.在要共享的文件夹上单击右键,选择“属性”。2.选择“共享”选项卡,然后选择“高级共享”。3.在“高级共享”对话框中,选中“共享此文件...

电脑复制粘贴不了是怎么回事

电脑无法复制粘贴原因分析及解决方法:如果是中病毒的话,会有以下的这些情况:1、系统不能上网,例如宽带账号无法登录,qq登录不上,网页无法打开。2、复制粘贴功能失效。3、电脑任务栏上的信息不能显示。4、...

win7一键烟雾头(win7烟雾头设置)

要调整Win7系统的烟雾头,首先需要打开“显示设置”窗口,在这个窗口中可以找到“分辨率”、“屏幕比例”等选项。接着,在“高级设置”中找到“显示适配器属性”选项,点击进入。在这个界面中,可以找到“3D设...

win7系统一键装机下载(w7一键安装操作系统)

可以在温十系统电脑上下载温七装机系统,但需要按照正确的步骤进行安装。以下是一个可能的安装步骤:1.在温十系统电脑上下载温七装机系统的ISO文件,可以从互联网上下载,也可以从其他媒体(如DVD或USB驱...

qq互联管理中心(qq互联管理中心是干什么的)

QQ互联是基于Discuz!云平台的一项服务,因此在开通QQ互联之前首先需要开通Discuz!云平台。在Discuz!X2中已经内置了云平台和相关服务,无需安装,在后台直接开启即可。可以呀,有...

取消回复欢迎 发表评论: