R语言利用caret包比较ROC曲线-CDA数据分析师官网

R语言利用caret包比较ROC曲线

2018-06-16

R语言利用caret包比较ROC曲线

我们之前探讨了多种算法，每种算法都有优缺点，因而当我们针对具体问题去判断选择那种算法时，必须对不同的预测模型进行重做评估。为了简化这个过程，我们使用caret包来生成并比较不同的模型与性能。
操作
加载对应的包与将训练控制算法设置为10折交叉验证，重复次数为3：
library(ROCR)
library(e1071)
library("pROC")
library(caret)
library("pROC")
control = trainControl(method = "repaetedcv",
                       number = 10,
                       repeats =3,
                       classProbs = TRUE,
                       summaryFunction = twoClassSummary)

使用glm在训练数据集上训练一个分类器

glm.model = train(churn ~ .,
                  data= trainset,
                  method = "glm",
                  metric = "ROC",
                  trControl = control)
使用svm在训练数据集上训练一个分类器

svm.model = train(churn ~ .,
                  data= trainset,
                  method = "svmRadial",
                  metric = "ROC",
                  trControl = control)
使用rpart函数查看rpart在训练数据集上的运行情况

rpart.model = train(churn ~ .,
                    data = trainset,
                    method = "svmRadial",
                    metric = "ROC",
                    trControl = control)
使用不同的已经训练好的数据分类预测：

glm.probs = predict(glm.model,testset[,!names(testset) %in% c("churn")],type = "prob")
svm.probs = predict(svm.model,testset[,!names(testset) %in% c("churn")],type = "prob")
rpart.probs = predict(rpart.model,testset[,!names(testset) %in% c("churn")],type = "prob")
生成每个模型的ROC曲线，将它们绘制在一个图中：

glm.ROC = roc(response = testset[,c("churn")],
              predictor = glm.probs$yes,
              levels = levels(testset[,c("churn")]))
plot(glm.ROC,type = "S",col = "red")

svm.ROC = roc(response = testset[,c("churn")],
              predictor = svm.probs$yes,
              levels = levels(testset[,c("churn")]))
plot(svm.ROC,add = TRUE,col = "green")

rpart.ROC = roc(response = testset[,c("churn")],
              predictor = rpart.probs$yes,
              levels = levels(testset[,c("churn")]))

plot(rpart.ROC,add = TRUE,col = "blue")

三种分类器的ROC曲线

说明

将不同的分类模型的ROC曲线绘制在同一个图中进行比较，设置训练过程的控制参数为重复三次的10折交叉验证，模型性能的评估参数为twoClassSummary,然后在使用glm,svm,rpart,三种不同的方法建立分类模型。
从图中可以看出，svm对训练集的预测结果（未调优）是三种分类算法里最好的。

CDA数据分析师考试相关入口一览（建议收藏）：

▷ 想报名CDA认证考试，点击>>> “CDA报名” 了解CDA考试详情；

▷ 想学习CDA考试教材，点击>>> “CDA教材” 了解CDA考试详情；

▷ 想加入CDA考试题库，点击>>> “CDA题库” 了解CDA考试详情；

▷ 想了解CDA考试含金量，点击>>> “CDA含金量” 了解CDA考试详情；

R语言

数据分析咨询请扫描二维码

若不方便扫码，搜微信号：CDAshujufenxi

上一篇python根据距离和时长计算配速示例

下一篇决策树、随机森林简单原理和实现

R语言利用caret包比较ROC曲线

CDA考试动态

CDA报考指南

热门栏目

最新资讯

【CDA干货】互联网运营必看：私域用户质量数据分析 ...

【CDA持证人案例分享】用 Excel 精准监控电商及推广 ...

【CDA持证人干货分享】13年国企财务：如何借助DeepS ...

【CDA持证人案例分享】Excel动态报表设计：基于业务 ...

【CDA干货】字节大佬：如何通过动态分级快速提升转 ...

Windows 系统和 MacOS 系统下的 Anaconda 安装教程 ...

数据运营的工作内容、技能要求及发展前景 ...

【干货】字节大佬：教培行业销售运营全景作战地图【 ...

四大一线城市约50%人口租房，数据分析能挖出哪些 “ ...

Python 实战案例 —RFM 客户价值分析模型 ...

【案例】奥利奥坚果新品与蒙牛“数字牧场”的成功经 ...

美关税政策下的全球金融市场动荡：深度数据分析与洞 ...

【重磅】苹果捐赠3000万给浙大这专业，透露未来就业 ...

非专业，怎么才能证明自己的数据分析能力？ ...

保姆级教程！一文读懂数据分析师的职业发展路径 ...

【干货】用DeepSeek三步骤搞定Excel数据清洗，效率 ...

被统计公式劝退？这门极简课程让你14天学会用Python ...

【干货】如何用RFM模型精准识别高价值客户？ ...

CDA数据分析师就业班3月29日开班，仅剩1个名额 ...

【案例】网飞Netflix流量漏斗分析案例 ...