这篇文章介绍的内容是详解分类评价指标和回归评价指标以及Python代码实现,有着一定的参考价值,现在分享给大家,有需要的朋友可以参考一下。

1、概念

性能度量(评价)指标,主分为两大类:

1)分类评价指标(classification),主要分析,离散的,整数的。其具体指标包括accuracy(准确率),precision(精确率),recall(召回率),F值,P-R曲线,ROC曲线和AUC。

2)回归评价指标(regression),主要分析整数和实数之间的关系。其具体指标包括可释方差得分(explianed_variance_score),平均绝对误差MAE(mean_absolute_error),均方误差MSE(mean-squared_error),均方根差RMSE,交叉熵lloss(Log loss,cross-entropy loss),R方值(确定系数,r2_score)。

1.1、前提假设只有两类-正类(positive)和负类(negative),通常以关注的类为正类,其他类为负类(故多类问题亦可归纳为两类)

混淆矩阵(Confusion matrix)如下实际类别预测类别

正负总结

正TPFNP(实际为正)

负FPTNN(实际为负)表中AB模式:第一个表示预测结果的对错,第二个表示预测的类别。如TP表示,True Positive,即正确的预测为正类;FN表示,False Negative,即错误的预测为了负类。

2、评价指标(性能度量)

2.1、分类评价指标2.1.1 值指标-Accuracy、Precision、Recall、F值度量Accuracy(准确率)Precision(精确率)Recall(召回率)F值

定义正确分类的样本数与总样本数之比(预测为垃圾短信中真正的垃圾短信的比例)判定为正例中真正正例数与判定为正例数之比(所有真的垃圾短信被分类求正确找出来的比例)被正确判定为正例数与总正例数之比准确率与召回率的调和平均F-score

表示accuracy=precision=recall=F - score =1.precision也常称为查准率,recall称为查全率

2.比较常用的是F1,

python3.6代码实现:#调用sklearn库中的指标求解from sklearn import metricsfrom sklearn.metrics import precision_recall_curvefrom sklearn.metrics import average_precision_scorefrom sklearn.metrics import accuracy_score#给出分类结果y_pred = [0, 1, 0, 0]

y_true = [0, 1, 1, 1]

print("accuracy_score:", accuracy_score(y_true, y_pred))

print("precision_score:", metrics.precision_score(y_true, y_pred))

print("recall_score:", metrics.recall_score(y_true, y_pred))

print("f1_score:", metrics.f1_score(y_true, y_pred))

print("f0.5_score:", metrics.fbeta_score(y_true, y_pred, beta=0.5))

print("f2_score:", metrics.fbeta_score(y_true, y_pred, beta=2.0))2.1.2 相关曲线-P-R曲线、ROC曲线及AUC值

1)P-R曲线

步骤:

1、从高到低将”score”值排序并依次作为阈值threshold;

2、对于每个阈值,”score”值大于或等于这个threshold的测试样本被认为正例,其他为负例。从而形成一组预测数。

eg.

将0.9作为阈值,则第1个测试样本为正例,2、3、4、5为负例

得到预测为正例预测为负例总计

正例(score大于阈值)0.90.11

负例(score小于阈值)0.2+0.3+0.3+0.35 = 1.150.8+0.7+0.7+0.65 = 2.854

precision=

recall=在阈值以下的部分,当作负例,则预测为负例的取值情况是正确预测值,即如果本身是正例,则取TP;如果本身是负例,则取TN,其都为预测分值。

python实现伪代码#precision和recall的求法如上

#主要介绍一下python画图的库

import matplotlib.pyplot ad plt

#主要用于矩阵运算的库

import numpy as np#导入iris数据及训练见前一博文

...

#加入800个噪声特征,增加图像的复杂度

#将150*800的噪声特征矩阵与150*4的鸢尾花数据集列合并

X = np.c_[X, np.random.RandomState(0).randn(n_samples, 200*n_features)]

#计算precision,recall得到数组

for i in range(n_classes):

#计算三类鸢尾花的评价指标, _作为临时的名称使用

precision[i], recall[i], _ = precision_recall_curve(y_test[:, i], y_score[:,i])#plot作图plt.clf()

for i in range(n_classes):

plt.plot(recall[i], precision[i])

plt.xlim([0.0, 1.0])

plt.ylim([0.0, 1.05])

plt.xlabel("Recall")

plt.ylabel("Precision")

plt.show()

将上述代码补充完整后得到鸢尾花数据集的P-R曲线

2)ROC曲线

横轴:假正例率 fp rate = FP / N

纵轴:真正例率 tp rate = TP / N

步骤:

1、从高到低将”score”值排序并依次作为阈值threshold;

2、对于每个阈值,”score”值大于或等于这个threshold的测试样本被认为正例,其他为负例。从而形成一组预测数。同P-R曲线计算类似,不再赘述

鸢尾花数据集的ROC图像为

AUC(Area Under Curve)定义为ROC曲线下的面积

AUC值提供了分类器的一个整体数值。通常AUC越大,分类器更好,取值为[0, 1]

2.2、回归评价指标

1)可释方差得分

2)平均绝对误差 MAE (Mean absolute error)

3)均方差 MSE (Mean squared error)

4)logistics回归损失

5)一致性评价 - pearson相关系数法

python代码实现from sklearn.metrics import log_loss

log_loss(y_true, y_pred)from scipy.stats import pearsonr

pearsonr(rater1, rater2)from sklearn.metrics import cohen_kappa_score

cohen_kappa_score(rater1, rater2)

python评价指标_详解分类评价指标和回归评价指标以及Python代码实现相关推荐

  1. mac安装python虚拟环境_详解Mac配置虚拟环境Virtualenv,安装Python科学计算包

    最近正在自学Python做科学计算,当然在很多书籍和公开课里最先做的就是安装Numpy, Scipy, Matplotlib等包,不过每次安装单独的包时,都会有各种问题导致安装失败或者调用失败. 比如 ...

  2. tensorflow对应的python版本_详解Tensorflow不同版本要求与CUDA及CUDNN版本对应关系

    参考官网地址: Windows端:https://tensorflow.google.cn/install/source_windows CPU Version Python version Comp ...

  3. 回撤率 python 平台_详解如何使用python计算一只股票的最大回撤率?

    详解如何使用python计算一只股票的最大回撤率? 一.什么是最大回撤率? 最大回撤率:在选定周期内任一历史时点往后推,产品净值走到最低点时的收益率回撤幅度的最大值.最大回撤用来描述买入产品后可能出现 ...

  4. python 标准输出_详解Python的标准输入输出

    本篇文章给大家分享的是详解Python的标准输入输出,内容挺不错的,希望可以帮助到有需要的朋友 一.标准输入输出 1.打印到屏幕 产生输出的最简单方法是使用print语句,可以通过用逗号分隔零个或多个 ...

  5. 用python画圆角矩形_详解微信小程序canvas圆角矩形的绘制的方法

    详解微信小程序canvas圆角矩形的绘制的方法 发布时间:2020-10-04 18:20:31 来源:脚本之家 阅读:103 作者:清夜 微信小程序允许对普通元素通过 border-radius 的 ...

  6. 独热编码python实现_详解深度学习中的独热编码

    很多人开始接触深度学习,数据处理遇到第一个专业英文术语就是one-hot encode(独热编码),很多初学者就会迷茫,这个东西是什么意思,其实说的直白点所谓的独热编码最重要的就是把一组字符串或者数字 ...

  7. python 深拷贝_详解python的复制,深拷贝和浅拷贝的区别

    概述 今天主要来看看Python中的浅拷贝和深拷贝内容,这里用一个实例来说明~ 需求: 将一个列表的数据复制到另一个列表中. 思路: 使用列表[:],拿不准可以调用copy模块. 实现方法: #!/u ...

  8. python 指纹_详解Python3之数据指纹MD5校验与对比

    MD5消息摘要算法(英语:MD5 Message-Digest Algorithm),一种被广泛使用的密码散列函数,可以产生出一个128位(16字节)的散列值(hash value),用于确保信息传输 ...

  9. python鸭制作类代码_详解duck typing鸭子类型程序设计与Python的实现示例

    在程序设计中,鸭子类型(英语:duck typing)是动态类型的一种风格.在这种风格中,一个对象有效的语义,不是由继承自特定的类或实现特定的接口,而是由当前方法和属性的集合决定. 这个概念的名字来源 ...

最新文章

  1. RESTful服务最佳实践
  2. 常量指针与指向常量的指针
  3. java 字母大写_Java字母大小写转换的方法
  4. Tensorflow深度学习应用(进阶篇)-1
  5. Ubuntu 16.04 卸载vmware
  6. class checklist
  7. Nginx启动/重启脚本详解
  8. spring与struts2 mvc共存web.xml简单配置
  9. J1939入门(一)
  10. 【交换机在江湖】第十五章 VLAN隔离篇
  11. 手把手教你整合SpringCloud微服務框架-dubbo框架+zookeeper服务的注册发现+druid数据源管理
  12. 算法系列经典书籍:计算机算法设计与分析(第三版)-王晓东编著-电子工业出版社(高清版课本+课后习题答案)
  13. ArduinoUNO实战-第八章-无源蜂鸣器
  14. 寒假2019培训:白银莲花池-usaco2007(洛谷P2411)
  15. org.springframework.util.AntPathMatcher:URL 与 匹配规则
  16. Echarts关系图-----注释
  17. 微商相册图文添加自己喜欢的文字呢
  18. 会计科目中的借贷理解
  19. 孩子像谁软件在线测试,测试你最像哪个动漫人物官方版
  20. 计算机数据库方向论文ei,Ei Compendex数据库收录中国论文统计分析

热门文章

  1. [工具]-WIKI/文档编写相关软件
  2. 流畅的python读书笔记④:文本和字节序列
  3. Matlab程序问题
  4. 数仓建设(离线和实时)
  5. 丁小平微积分研究成果刍议
  6. 关于RNN理论和实践的一些总结
  7. 首款开源软硬一体OpenCV AI Kit(OAK)用户问题官方答疑实录 QA
  8. 11.Django基础九之中间件
  9. 关于网卡eth0、eth1以及服务器为什么要把内网和外网卡区分开
  10. matlab删除行向量里面相同的数据