在上一篇博文《决策树的sklearn实现》中，我们建立了一棵完整的决策树，但是如果在建立模型时不设置random_state的数值，score会在某个值附近波动，引起画出来的每一棵树都不一样。它为什么会不稳定呢？如果使用其他数据集，它还会不稳定吗？
无论决策树模型如何进化，在分支上的本质都还是追求某个不纯度相关指标的优化，而不纯度是基于结点计算的，也就是说，决策树在建树时，是靠优化节点来追求一棵优化的树，但最优的结点能够保证最优的树吗？集成算法被用来解决这一问题：sklearn表示，既然一棵树不能保证最优，那就建更多的不同的树，然后从中取最好的。怎样从一组数据集中建不同的树？在每次分支时，不用全部特征，而是随机选取一部分特征，从中选取不纯度相关指标最优的作为分支用的结点。这样，每次生成的树也就不同了。

clf = tree.DecisionTreeClassifier(criterion="entropy",random_state=100)
clf = clf.fit(Xtrain, Ytrain)
score = clf.score(Xtest, Ytest) #返回预测的准确度
score

运行结果

0.9814814814814815

random_state & splitter

random_state用来设置分支中的随机模式的参数，默认None，在高维度时随机性会表现更明显，低维度的数据(比如鸢尾花数据集)，随机性几乎不会显现。输入任意整数，会一直长出同一棵树，让模型稳定下来。
splitter也是用来控制决策树中的随机选项的，有两种输入值，输入”best"，决策树在分支时虽然随机，但是还是会优先选择更重要的特征进行分支(重要性可以通过属性feature_importances_查看)，输入“random"，决策树在⽀支时会更加随机，树会因为含有更多的不必要信息而更深更大，并因这些不必要信息而降低对训练集的拟合。
这也是防止过拟合的一种方式。
当你预测到你的模型会过拟合，用这两个参数来帮助你降低树建成之后过拟合的可能性。当然，树一旦建成，我们依然是使用剪枝参数来防止过拟合。

clf = tree.DecisionTreeClassifier(criterion="entropy",random_state=30,splitter="random",max_depth=5,min_samples_leaf=5,min_samples_split=10)
clf = clf.fit(Xtrain, Ytrain)
dot_data = tree.export_graphviz(clf,feature_names= feature_name,class_names=["琴酒","雪莉","贝尔摩德"],filled=True,rounded=True)
graph = graphviz.Source(dot_data)
graph

sklearn决策树之random_state splitter相关推荐

第十二课.sklearn决策树实验
目录实验数据数据分析 sklearn决策树分类实验数据本实验基于某信息公司的用户数据,使用决策树和可视化工具进行用户流失分析,从而预测哪类用户更容易流失,帮助公司制定相应的预防措施.实验所需数 ...
sklearn决策树预剪枝
<老饼讲解机器学习>http://ml.bbbdata.com/teach#102 目录一.预剪枝即调参二.调参方法 (1) 默认值预观察生长的树 (2) 参数限制节点过分生长为预防 ...
细讲sklearn决策树后剪枝(带例子)
<老饼讲解机器学习>http://ml.bbbdata.com/teach#103 目录一.CCP后剪枝简介二.剪枝操作过程 (1) 查看CCP路径 (2)根据CCP路径剪树为预防模 ...
sklearn——决策树
总结sklearn决策树的使用,方便以后查阅. 1.分类决策树 (基于CART树) 原型: 参数: 2.回归分类树原型: 参数: 3.export_graphviz 当训练完毕一颗决策树时,可以 ...
sklearn模型中random_state参数的意义
sklearn模型中random_state参数的意义 random_state 意义使用情况 random_state 意义例如:在sklearn可以随机分割训练集和测试集(交叉验证),只需要在 ...
sklearn 决策树(分类树、回归树)的重要参数、属性、方法理解
文章目录决策分类树引入重要参数 1,criterion 2,splitter 3,max_depth 4,min_samples_leaf 5,min_samples_split 6,max_f ...
sklearn 决策树例子_决策树--规则挖掘应用
本次主要简单介绍下决策树在风控规则中的简单应用,让读者快速入门.在后续的文章中,会逐一介绍决策树的各种算法原理,如信息增益.ID3算法.C4.5算法.C5.0算法等, 希望感兴趣的朋友可以关注下. 前 ...
wpf展开树节点_回归树分析与sklearn决策树案例，来玩一会
摘要: 决策树是非常基础的算法,其不仅能够进行分类还可以进行回归处理,也就是回归树.要想提高决策树的性能还需要做好剪枝的工作. 关键词: 回归树,剪枝 1 回归树之前已经介绍过决策树的基本理论了:这 ...
python机器学习库sklearn——决策树
全栈工程师开发手册 (作者:栾鹏) python数据挖掘系列教程决策树的相关的知识内容可以参考 http://blog.csdn.net/luanpeng825485697/article/deta ...

sklearn决策树之random_state splitter

random_state & splitter

sklearn决策树之random_state splitter相关推荐

最新文章

热门文章