拓端tecdat|R语言逻辑回归(Logistic回归)模型分类预测病人冠心病风险
最近我们被客户要求撰写关于冠心病风险的研究报告,包括一些图形和统计输出。
相关视频:R语言逻辑回归(Logistic回归)模型分类预测病人冠心病风险
逻辑回归Logistic模型原理和R语言分类预测冠心病风险实例
,时长06:48
本文的目的是完成一个逻辑回归分析。使你对分析步骤和思维过程有一个基本概念。
library(tidyverse)
library(broom)
这些数据来自一项正在进行的对镇居民的心血管研究。其目的是预测一个病人是否有未来10年的冠心病风险。该数据集包括以下内容。
- 男性:0=女性;1=男性
- 年龄。
- 教育。1 = 高中以下;2 = 高中;3 = 大学或职业学校;4 = 大学以上
- 当前是否吸烟。0=不吸烟;1=吸烟者
- cigsPerDay: 每天抽的烟数量(估计平均)。
- BPMeds: 0 = 不服用降压药;1 = 正在服用降压药
- 中风。0 = 家族史中不存在中风;1 = 家族史中存在中风
- 高血压。0 =高血压在家族史上不流行;1 =高血压在家族史上流行
- 糖尿病:0 = 没有;1 = 有
- totChol: 总胆固醇(mgdL)
- sysBP: 收缩压(mmHg)
- diaBP: 舒张压(mmHg)
- BMI: 体重指数
- 心率
- 葡萄糖:总葡萄糖mgdL
- TenYearCHD: 0 = 患者没有未来10年冠心病的风险; 1 = 患者有未来10年冠心病的风险
加载并准备数据
read_csv("framingham.csv") %>%drop_na() %>% #删除具有缺失值的观察值ageCent = age - mean(age), totCholCent = totChol - mean(totChol),
拟合逻辑回归模型
glm(TenYearCHD ~ age + Smoker + CholCent, data = data, family = binomial)
预测
对于新病人
data_frame(ageCent = (60 - 49.552), totCholCent = (263 - 236.848),
预测对数几率
predict(risk_m, x0)
预测概率
根据这个概率,你是否认为这个病人在未来10年内有患冠心病的高风险?为什么?
risk
混淆矩阵
risk_m %>%group_by(TenYearCHD, risk_predict) %>%kable(format="markdown")
mutate( predict = if_else(.fitted > threshold, "1: Yes", "0: No"))
有多大比例的观察结果被错误分类?
依靠混淆矩阵来评估模型的准确性有什么缺点?
ROC曲线
ggplot(risk_m_aug, oc(n.cuts = 10, labelround = 3) + geom_abline(intercept = 0) +
auc(roc )$AUC
一位医生计划使用你的模型的结果来帮助选择病人参加一个新的心脏病预防计划。她问你哪个阈值最适合为这个项目选择病人。根据ROC曲线,你会向医生推荐哪个阈值?为什么?
假设
为什么我们不绘制原始残差?
ggplot(data = risk aes(x = .fitted, y = .resid)) +labs(x = "预测值", y = "原始残差")
分级的残差图
plot(x = fitted, y = resid,xlab = "预测概率", main = "分级后的残值与预测值的对比",
## # A tibble: 2 x 2
## currentSmoker mean_resid
## <fct> <dbl>
## 1 0 -2.95e-14
## 2 1 -2.42e-14
检查假设:
- 线性?- 随机性?- 独立性?
系数的推断
currentSmoker1的测试统计量是如何计算的?
在统计学上,totalCholCent是否是预测一个人患冠心病高风险的重要因素?
用检验统计量和P值来证明你的答案。
用置信区间说明你的答案。
偏离偏差检验
glm(TenYearCHD ~ ageCent + currentSmoker + totChol, data = heart_data, family = binomial)
anova
AIC
根据偏离偏差检验,你会选择哪个模型?
基于AIC,你会选择哪个模型?
使用step逐步回归
选择模型
step(full_model )
kable(format = "markdown" )
拓端tecdat|R语言逻辑回归(Logistic回归)模型分类预测病人冠心病风险相关推荐
- 拓端tecdat|R语言用LOESS(局部加权回归)季节趋势分解(STL)进行时间序列异常检测
最近我们被客户要求撰写关于LOESS(局部加权回归)的研究报告,包括一些图形和统计输出. 这篇文章描述了一种对涉及季节性和趋势成分的时间序列的中点进行建模的方法.我们将对一种叫做STL的算法进行研究, ...
- 拓端tecdat|R语言线性回归和时间序列分析北京房价影响因素可视化案例
最近我们被客户要求撰写关于北京房价影响因素的研究报告,包括一些图形和统计输出. 目的 房价有关的数据可能反映了中国近年来的变化: 人们得到更多的资源(薪水),期望有更好的房子 人口众多 独生子女政策: ...
- 拓端tecdat|R语言向量误差修正模型 (VECMs)分析长期利率和通胀率影响关系
最近我们被客户要求撰写关于向量误差修正模型的研究报告,包括一些图形和统计输出. 向量自回归模型估计的先决条件之一是被分析的时间序列是平稳的.但是,经济理论认为,经济变量之间在水平上存在着均衡关系,可以 ...
- R语言glm拟合logistic回归模型实战:基于glm构建逻辑回归模型及模型系数统计显著性分析、每个预测因子对响应变量的贡献
R语言glm拟合logistic回归模型实战:基于glm构建逻辑回归模型及模型系数统计显著性分析.每个预测因子对响应变量的贡献 目录
- R语言广义线性模型Logistic回归模型亚组分析及森林图绘制
R语言广义线性模型Logistic回归模型亚组分析及森林图绘制 #Logistic回归案例 6 亚组分析森林图 library(forestplot) rs_forest <- read.csv ...
- R语言glm拟合logistic回归模型:模型评估(模型预测概率的分组密度图、混淆矩阵、准确率、精确度、召回率、ROC、AUC)、PRTPlot函数获取logistic模型最优阈值(改变阈值以优化)
R语言glm拟合logistic回归模型:模型评估(模型预测概率的分组密度图.混淆矩阵.Accuray.Precision.Recall.ROC.AUC).PRTPlot函数可视化获取logistic ...
- R语言glm拟合logistic回归模型:模型评估(计算模型拟合的统计显著性)、模型评估(赤信息AIC指标计算)
R语言glm拟合logistic回归模型:模型评估(计算模型拟合的统计显著性).模型评估(赤信息AIC指标计算) 目录
- R语言广义线性模型Logistic回归案例代码
R语言广义线性模型Logistic回归案例代码 在实际应用中,Logistic模型主要有三大用途: 1)寻找危险因素,找到某些影响因变量的"坏因素",一般可以通过优势比发现危险因素 ...
- R语言广义线性模型Logistic回归模型列线图分析(nomogram)
R语言广义线性模型Logistic回归模型列线图分析(nomogram) 我们来看图说话: gist是一种胃肠道间质瘤,作者构建了无复发生存率的logistic回归模型. 并构建了如下的列线图或者no ...
最新文章
- IntelliJ IDEA 2020.2.4款 神级超级牛逼插件推荐
- Python中单个下划线“ _”变量的用途是什么?
- WINCE5 s3c2440_SD驱动知识补充
- boost::nowide模块相关的测试程序
- php去掉 x5E,清除wordpress里PHP文件恶意代码
- 官网消息【iPlayer外挂字幕】功能开发中!有图
- LeetCode刷题——125. 验证回文串
- 转帖:一份不错的游戏程序书单(比较全面,但都是英文的。。)
- ubunt 文件permission denied问题的解决
- python 定时任务框架APScheduler
- 大牛手把手带你!mysql视频教程百度网盘
- 老男孩第十四期Python学习班之Day02
- 转载 | 深度学习中的遥感影像数据集
- 【Android UI设计与开发】5.底部菜单栏(二)使用Fragment实现底部菜单栏
- DDR controller控制器之AXI接口模块设计
- ISA, x86,x86_64, AMD64, 指令集等名词解析
- 金融壹账通企业金融CEO费轶明:金融服务业进入以技术为动力的时代
- 积极响应号召_30多个“号召性用语”按钮模板下载
- Python Ecosystem之Python篇章二
- 键盘输入任意字符串,打乱里面的内容