R语言学习之决策树-CDA数据分析师官网

热线电话：13121318867

首页精彩阅读R语言学习之决策树

R语言学习之决策树

2015-12-10

R语言学习之决策树

决策树最重要的2个问题：决策树的生长问题，决策树的剪枝问题。

生长问题又包括了2个子问题：从分组变量的众多取值中选择一个最佳分割点和从众多输入变量中选择当前最佳分组变量；

剪枝问题包括2个子问题：预修剪（事先指定树的最大深度，叶子的最小样本量等）和后修剪（先让树充分生长，然后边修剪边检验）。

在R中，实现决策树需要加载包library(rpart)，如果想把分类图画的漂亮点，还可以加载这个包：library(rpart.plot)

## rpart.control对树进行一些设置

## xval是10折交叉验证

## minsplit是最小分支节点数，这里指大于等于20，那么该节点会继续分划下去，否则停止

## minbucket：叶子节点最小样本数

## maxdepth：树的深度

## cp全称为complexity parameter，指某个点的复杂度，对每一步拆分,模型的拟合优度必须提高的程度，用来节省剪枝浪费的不必要的时间，R内部是怎么计算的还真不知道唉

ct <- rpart.control(xval=10, minsplit=20, cp=0.1)

## kyphosis是rpart这个包自带的数据集

## na.action：缺失数据的处理办法，默认为删除因变量缺失的观测而保留自变量缺失的观测。

## method：树的末端数据类型选择相应的变量分割方法:

## 连续性method=“anova”,离散型method=“class”,计数型method=“poisson”,生存分析型method=“exp”

## parms用来设置三个参数:先验概率、损失矩阵、分类纯度的度量方法（gini和information）

## cost我觉得是损失矩阵，在剪枝的时候，叶子节点的加权误差与父节点的误差进行比较，考虑损失矩阵的时候，从将“减少-误差”调整为“减少-损失”

fit <- rpart(Kyphosis~Age + Number + Start,

data=kyphosis, method="class",control=ct，

parms = list(prior = c(0.65,0.35), split = "information"));

## 作图有2种方法

## 第一种：

par(mfrow=c(1,3));plot(fit); text(fit,use.n=T,all=T,cex=0.9)

## 第二种，这种会更漂亮一些：

rpart.plot(fit, branch=1, branch.type=2, type=1, extra=102,

shadow.col="gray", box.col="green",

border.col="blue", split.col="red",

split.cex=1.2, main="Kyphosis决策树");

## rpart包提供了复杂度损失修剪的修剪方法，printcp会告诉分裂到每一层，cp是多少，平均相对误差是多少

## 交叉验证的估计误差（“xerror”列），以及标准误差(“xstd”列)，平均相对误差=xerror±xstd

printcp(fit)

## 通过上面的分析来确定cp的值

## 我们可以用下面的办法选择具有最小xerror的cp的办法：

## prune(fit, cp= fit$cptable[which.min(fit$cptable[,"xerror"]),"CP"])

fit2 <- prune(fit, cp=0.01)

待续。。。。。。

注：

1.在预测分类目标字段时为类别指定先验概率。先验概率是对总体（从中可提取训练数据）中的每个目标分类的总相对频率的估计。换句话说，先验概率是对预测值有任何了解之前对每个可能的目标值的概率估计。确定决策树分支准则的时候会用到，具体内部算法，我暂时还没有查到。

CDA数据分析师考试相关入口一览（建议收藏）：

▷ 想报名CDA认证考试，点击>>> “CDA报名” 了解CDA考试详情；

▷ 想学习CDA考试教材，点击>>> “CDA教材” 了解CDA考试教材；

▷ 想加入CDA考试题库，点击>>> “CDA题库” 了解CDA考试题库；

▷ 想了解CDA考试含金量，点击>>> “CDA含金量” 了解CDA考试详情；

▷ 想了解CDA院校合作，点击>>> “院校合作” 了解咨询CDA院校合作；

决策树先验概率字段 R语言概率估计

数据分析咨询请扫描二维码

若不方便扫码，搜微信号：CDAshujufenxi

上一篇图论在大数据分析中的作用！

下一篇CDA认证再升一档！与国家共同推进大数据人才培养标准教育事业！

数据分析师考试动态

CDA报考指南

数据分析学习

数据分析师资讯

京公网安备 11010802034615号经营许可证编号：京B2-20210330

联系电话：13321103290 (微信同号)

客服在线

立即咨询

客服在线

立即咨询

免密码登录

提交首次登录验证后自动注册

R语言学习之决策树

数据分析师考试动态

CDA报考指南

数据分析学习

数据分析师资讯

【CDA干货】详解B+树叶子节点指针：双向还是单向？ ...

【CDA干货】警惕！REPLACE(UUID(), '-', '')用于INS ...

CDA数据分析师与商业数据分析总体流程：全链路实操 ...

【CDA干货】通过标准差与平均值关系衡量数据波动性 ...

【CDA干货】基于GB标准的t检验、F检验与显著性差异 ...

CDA数据分析师与统计制图：以可视化赋能数据叙事与 ...

【CDA干货】箱线图上下限在线计算：原理、工具与实 ...

【CDA干货】多重共线性下的变量保留策略：平衡信息 ...

CDA数据分析师与六种核心分析方法：从工具到价值的 ...

【CDA干货】特征重要性分析：从模型到业务的核心决 ...

【CDA干货】关联分析之支持度：核心指标的本质、应 ...

CDA数据分析师与数据分析基础范式：方法论落地与价 ...

【CDA干货】巧用AI生成SQL语句：基于数据库字典的精 ...

【CDA干货】支持向量机处理非线性问题：核技巧的原 ...

数据分析与CDA数据分析师：核心概念与价值逻辑 ...

【CDA干货】数据分析指标选取：从原则到场景的实操 ...

【CDA干货】MySQL核心逻辑：为何SELECT在ORDER BY前 ...

CDA数据分析师：企业数字化转型的核心引擎与价值抓 ...

〖提高职业含金量〗数据分析师认证考核！ ...

【CDA干货】数据模型：连接业务与数据的核心逻辑框 ...

CDA教育闭环

常见问题

关于我们

CDA数据分析师公众号

CDA考试中心小程序

CDA数据分析师App下载