百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术资源 > 正文

机器学习入门第三章:决策树分类器-理论

off999 2024-11-26 07:24 20 浏览 0 评论


欢迎来到监督学习的第三种基本分类算法。 决策树。 像前面的章节(第1章:朴素贝叶斯和第2章:SVM分类器)一样,本章也分为两部分:理论和编码练习。

在这一部分中,我们将讨论理论和决策树背后的工作。 我们将看到该算法的一些数学方面,即熵和信息增益。 在第二部分中,我们修改了sklearn库中用于决策树分类器的垃圾邮件分类代码。 我们将比较朴素贝叶斯和SVM的准确性。

0.动机

假设我们有两个用黑色圆圈和蓝色方块表示的类的图。 可以画一条单独的分隔线吗? 也许没有。

我们将需要多个行来划分类。 与下图类似:

我们需要两条线,一条根据x的阈值分开,另一条根据y的阈值分开。

您现在已经猜到了决策树将要做什么。

决策树分类器通过识别线将工作区域(图)重复地划分为子部分。 (重复,因为如下图所示,可能存在两个相同类别的遥远区域除以另一个)。

那么它何时终止?

· 要么将其划分为纯类(仅包含单个类的成员)

· 满足分类器属性的某些条件。

我们很快将看到这两点。

1.杂质

在上面的划分中,我们清楚地划分了班级。 但是,如果我们有以下情况怎么办?

不纯是指我们有将一类划分为另一类的痕迹。 这可能是由于以下原因引起的

· 我们没有可用的功能来划分类。

· 我们可以忍受一定百分比的杂质(我们停止进一步的除法),以提高性能。 (在准确性和性能之间总是要取舍)。

例如,在第二种情况下,当我们剩下的元素数量少于x时,我们可以停止除法。 这也称为基尼杂质。


2.熵

熵是元素的随机度,换句话说,它是杂质的量度。 在数学上,可以借助以下几项的概率来计算:

它是概率x项x的概率对数的负和。
例如,如果我们将项目作为投掷事件中骰子面的出现次数为1123,则熵为

p(1) = 0.5 p(2) = 0.25 p(3) = 0.25entropy = - (0.5 * log(0.5)) - (0.25 * log(0.25)) -(0.25 * log(0.25) = 0.45


3.信息获取

假设我们有多个功能来划分当前工作集。 我们应该选择什么功能进行划分? 也许可以减少我们的杂质。

假设我们按如下所示将类划分为多个分支,则任何节点上的信息增益定义为

Information Gain (n) = Entropy(x) — ([weighted average] * entropy(children for feature))

这需要一点解释!

假设我们最初有以下课程可以使用

112234445

假设我们根据属性对其进行划分:可被2整除


根级熵:0.66左子级熵:0.45,加权值=(4/9)* 0.45 = 0.2右子级熵:0.29,加权值=(5/9)* 0.29 = 0.16信息增益= 0.66-[ 0.2 + 0.16] = 0.3

如果我们将决策作为质数而不是除以2,请检查我们获得了哪些信息增益?在这种情况下,哪种方法更好?

每一阶段的决策树都选择提供最佳信息增益的决策树。 当信息增益为0时,表示该功能完全不划分工作集。

让我们解决一个例子

既然您已经了解了决策树的基本知识,就可以解决示例并了解其工作原理。

假设我们有以下各种条件下打高尔夫球的数据。

现在,如果天气条件为:

前景:阴雨,温度:凉爽,湿度:高,大风:假

我们应该打高尔夫球吗?

开始时我们得到结果,因为NNYYYNYN(Y =是,N =否)按给定顺序进行。现在该根节点的熵为0.3,现在尝试对各种预测变量的前景,温度,湿度和Windy进行划分,并分别计算信息增益。哪一个信息增益最高?例如,如果基于Outlook进行划分,则划分如下:Rainy:NNN(熵= 0)Sunny:YYN(熵= 0.041)阴天:YY(熵= 0)因此信息增益= 0.3 -[0 +(3/8)* 0.041 + 0] = 0.28其他情况下,请尝试一下。基于Outlook划分时,信息增益最大。现在,Rainy和Overcast的杂质为0。在此不再赘述。我们需要分开Sunny,如果除以Windy,我们将获得最大的信息增益。Sunny YYN Windy?是:N否:YY因此决策树看起来如下图所示。没有预测数据是Outlook:下雨,温度:凉爽,湿度:高,多风:错误根据结果从树上流下,我们首先检查Rainy?答案是不,我们不打高尔夫球。



我希望本节对理解决策树分类器背后的工作有所帮助。 如果您有任何意见,建议或建议,请在下方写下来。

最后的想法

基于最大信息增益进行有效划分是决策树分类器的关键。 但是,在现实世界中,将数以百万计的数据划分为纯类实际上是不可行的(可能需要更长的训练时间),因此当满足某些参数(例如杂质百分比)时,我们会停在树节点上的点。 我们将在编码练习中看到这一点。

在下一部分中,我们将使用sklearn库在Python中编写决策树分类器。 我们将调整一些参数以通过容忍一些杂质来获得更高的精度。

在以下各节中,我们定义一些与决策树相关的术语,然后使用示例示例执行这些计算。


(本文翻译自Savan Patel的文章《Chapter 3 : Decision Tree Classifier — Theory》,参考:https://medium.com/machine-learning-101/chapter-3-decision-trees-theory-e7398adac567)

相关推荐

PYTHON-简易计算器的元素介绍

[烟花]了解模板代码的组成importPySimpleGUIassg#1)导入库layout=[[],[],[]]#2)定义布局,确定行数window=sg.Window(&#...

如何使用Python编写一个简单的计算器程序

Python是一种简单易学的编程语言,非常适合初学者入门。本文将教您如何使用Python编写一个简单易用的计算器程序,帮助您快速进行基本的数学运算。无需任何高深的数学知识,只需跟随本文的步骤,即可轻松...

用Python打造一个简洁美观的桌面计算器

最近在学习PythonGUI编程,顺手用Tkinter实现了一个简易桌面计算器,功能虽然不复杂,但非常适合新手练手。如果你正在学习Python,不妨一起来看看这个项目吧!项目背景Tkint...

用Python制作一个带图形界面的计算器

大家好,今天我要带大家使用Python制作一个具有图形界面的计算器应用程序。这个项目不仅可以帮助你巩固Python编程基础,还可以让你初步体验图形化编程的乐趣。我们将使用Python的tkinter库...

用python怎么做最简单的桌面计算器

有网友问,用python怎么做一个最简单的桌面计算器。如果只强调简单,在本机运行,不考虑安全性和容错等的话,你能想到的最简单的方案是什么呢?我觉得用tkinter加eval就够简单的。现在开整。首先创...

说好的《Think Python 2e》更新呢!

编程派微信号:codingpy本周三脱更了,不过发现好多朋友在那天去访问《ThinkPython2e》的在线版,感觉有点对不住呢(实在是没抽出时间来更新)。不过还好本周六的更新可以实现,要不就放一...

构建AI系统(三):使用Python设置您的第一个MCP服务器

是时候动手实践了!在这一部分中,我们将设置开发环境并创建我们的第一个MCP服务器。如果您从未编写过代码,也不用担心-我们将一步一步来。我们要构建什么还记得第1部分中Maria的咖啡馆吗?我们正在创...

函数还是类?90%程序员都踩过的Python认知误区

那个深夜,你在调试代码,一行行检查变量类型。突然,一个TypeError错误蹦出来,你盯着那句"strobjectisnotcallable",咖啡杯在桌上留下了一圈深色...

《Think Python 2e》中译版更新啦!

【回复“python”,送你十本电子书】又到了周三,一周快过去一半了。小编按计划更新《ThinkPython2e》最新版中译。今天更新的是第五章:条件和递归。具体内容请点击阅读原文查看。其他章节的...

Python mysql批量更新数据(兼容动态数据库字段、表名)

一、应用场景上篇文章我们学会了在pymysql事务中批量插入数据的复用代码,既然有了批量插入,那批量更新和批量删除的操作也少不了。二、解决思路为了解决批量删除和批量更新的问题,提出如下思路:所有更新语...

Python Pandas 库:解锁 combine、update 和compare函数的强大功能

在Python的数据处理领域,Pandas库提供了丰富且实用的函数,帮助我们高效地处理和分析数据。今天,咱们就来深入探索Pandas库中四个功能独特的函数:combine、combine_fi...

记录Python3.7.4更新到Python.3.7.8

Python官网Python安装包下载下载文件名称运行后选择升级选项等待安装安装完毕打开IDLE使用Python...

Python千叶网原图爬虫:界面化升级实践

该工具以Python爬虫技术为核心,实现千叶网原图的精准抓取,突破缩略图限制,直达高清资源。新增图形化界面(GUI)后,操作门槛大幅降低:-界面集成URL输入、存储路径选择、线程设置等核心功能,...

__future__模块:Python语言版本演进的桥梁

摘要Python作为一门持续演进的编程语言,在版本迭代过程中不可避免地引入了破坏性变更。__future__模块作为Python兼容性管理的核心机制,为开发者提供了在旧版本中体验新特性的能力。本文深入...

Python 集合隐藏技能:add 与 update 的致命区别,90% 开发者都踩过坑

add函数的使用场景及错误注意添加单一元素:正确示例:pythons={1,2}s.add(3)print(s)#{1,2,3}错误场景:试图添加可变对象(如列表)会报错(Pytho...

取消回复欢迎 发表评论: