本文摘要 · 理论来源:【统计学习方法】第七章 SVM
· 技术支持:pandas(读csv)、numpy、sklearn.svm、svm思想、matplotlib.pyplot(绘图)
· 代码目的:利用sklearn的svm模型,对鸢尾花数据集进行二分类,同时,对比感知机与线性可分向量机训练效果。
作者:CSDN 征途黯然.

  

一、鸢尾花(iris)数据集

  Iris 鸢尾花数据集是一个经典数据集,在统计学习和机器学习领域都经常被用作示例。数据集内包含 3 类共 150 条记录,每类各 50 个数据,每条记录都有 4 项特征:花萼长度、花萼宽度、花瓣长度、花瓣宽度,可以通过这4个特征预测鸢尾花卉属于(iris-setosa, iris-versicolour, iris-virginica)中的哪一品种。
下载地址:点击此处

二、代码描述

  1、首先加载数据,数据特征保留2维,便于我们绘制2d图。
  2、然后,测试不同正则化参数C下,线性可分支持向量机训练的效果。

三、效果图

  线性可分支持向量机效果:

  感知机效果:见【统计学习方法】感知机对鸢尾花(iris)数据集进行二分类

四、python代码(注释详细)

import pandas as pd
import matplotlib.pyplot as plt
import numpy as np
from sklearn.linear_model import Perceptron"""自定义感知机模型"""
# 数据线性可分,二分类数据
# 此处为一元一次线性方程
class Model:def __init__(self):# 创建指定形状的数组,数组元素以 1 来填充self.w = np.ones(len(data[0]) - 1, dtype=np.float32)self.b = 0  # 初始w/b的值self.l_rate = 0.1# self.data = datadef sign(self, x, w, b):y = np.dot(x, w) + b  # 求w,b的值# Numpy中dot()函数主要功能有两个:向量点积和矩阵乘法。# 格式:x.dot(y) 等价于 np.dot(x,y) ———x是m*n 矩阵 ,y是n*m矩阵,则x.dot(y) 得到m*m矩阵return y# 随机梯度下降法# 随机梯度下降法(SGD),随机抽取一个误分类点使其梯度下降。根据损失函数的梯度,对w,b进行更新def fit(self, X_train, y_train):  # 将参数拟合 X_train数据集矩阵 y_train特征向量is_wrong = False# 误分类点的意思就是开始的时候,超平面并没有正确划分,做了错误分类的数据。while not is_wrong:wrong_count = 0  # 误分为0,就不用循环,得到w,bfor d in range(len(X_train)):X = X_train[d]y = y_train[d]if y * self.sign(X, self.w, self.b) <= 0:# 如果某个样本出现分类错误,即位于分离超平面的错误侧,则调整参数,使分离超平面开始移动,直至误分类点被正确分类。self.w = self.w + self.l_rate * np.dot(y, X)  # 调整w和bself.b = self.b + self.l_rate * ywrong_count += 1if wrong_count == 0:is_wrong = Truereturn 'Perceptron Model!'# 得分def score(self):pass# 导入数据集
df = pd.read_csv('./iris/Iris.csv', usecols=[1, 2, 3, 4, 5])# pandas打印表格信息
# print(df.info())# pandas查看数据集的头5条记录
# print(df.head())"""绘制训练集基本散点图,便于人工分析,观察数据集的线性可分性"""
# 表示绘制图形的画板尺寸为8*5
plt.figure(figsize=(8, 5))
# 散点图的x坐标、y坐标、标签
plt.scatter(df[:50]['SepalLengthCm'], df[:50]['SepalWidthCm'], label='Iris-setosa')
plt.scatter(df[50:100]['SepalLengthCm'], df[50:100]['SepalWidthCm'], label='Iris-versicolor')
plt.scatter(df[100:150]['SepalLengthCm'], df[100:150]['SepalWidthCm'], label='Iris-virginica')
plt.xlabel('SepalLengthCm')
plt.ylabel('SepalWidthCm')
# 添加标题 '鸢尾花萼片的长度与宽度的散点分布'
plt.title('Scattered distribution of length and width of iris sepals.')
# 显示标签
plt.legend()
plt.show()# 取前100条数据中的:前2个特征+标签,便于训练
data = np.array(df.iloc[:100, [0, 1, -1]])
# 数据类型转换,为了后面的数学计算
X, y = data[:, :-1], data[:, -1]
y = np.array([1 if i == 'Iris-setosa' else -1 for i in y])"""自定义感知机模型,开始训练"""
perceptron = Model()
perceptron.fit(X, y)
# 最终参数
print(perceptron.w, perceptron.b)
# 绘图
x_points = np.linspace(4, 7, 10)
y_ = -(perceptron.w[0] * x_points + perceptron.b) / perceptron.w[1]
plt.plot(x_points, y_)
plt.scatter(df[:50]['SepalLengthCm'], df[:50]['SepalWidthCm'], label='Iris-setosa')
plt.scatter(df[50:100]['SepalLengthCm'], df[50:100]['SepalWidthCm'], label='Iris-versicolor')
plt.xlabel('SepalLengthCm')
plt.ylabel('SepalWidthCm')
# 添加标题 '自定义感知机模型训练结果'
plt.title('Training results of Custom perceptron model.')
plt.legend()
plt.show()"""sklearn感知机模型,开始训练"""
# 使用训练数据进行训练
clf = Perceptron()
# 得到训练结果,权重矩阵
clf.fit(X, y)
# Weights assigned to the features.输出特征权重矩阵
# print(clf.coef_)
# 超平面的截距 Constants in decision function.
# print(clf.intercept_)
# 对测试集预测
# print(clf.predict([[6.0, 4.0]]))
# 对训练集评分
# print(clf.score(X, y))# 绘图
x_points = np.linspace(4, 7, 10)
y_ = -(clf.coef_[0][0] * x_points + clf.intercept_[0]) / clf.coef_[0][1]
plt.plot(x_points, y_)
plt.scatter(df[:50]['SepalLengthCm'], df[:50]['SepalWidthCm'], label='Iris-setosa')
plt.scatter(df[50:100]['SepalLengthCm'], df[50:100]['SepalWidthCm'], label='Iris-versicolor')
plt.xlabel('SepalLengthCm')
plt.ylabel('SepalWidthCm')
# 添加标题 'sklearn感知机模型训练结果'
plt.title('Training results of sklearn perceptron model.')
plt.legend()
plt.show()

【统计学习方法】线性可分支持向量机对鸢尾花(iris)数据集进行二分类相关推荐

  1. 【统计学习方法】K近邻对鸢尾花(iris)数据集进行多分类

    本文摘要 · 理论来源:[统计学习方法]第三章 K近邻 · 技术支持:pandas(读csv).collections.Counter(统计).numpy.sklearn.neighbors.KNei ...

  2. 【统计学习方法】感知机对鸢尾花(iris)数据集进行二分类

    本文摘要 · 理论来源:[统计学习方法]第二章 感知机 · 技术支持:pandas(读csv).matplotlib(画图).numpy.sklearn.linear_model.Perceptron ...

  3. TF之LiR:利用TF自定义一个线性分类器LiR对乳腺癌肿瘤数据集进行二分类预测(良/恶性)

    TF之LiR:利用TF自定义一个线性分类器LiR对乳腺癌肿瘤数据集进行二分类预测(良/恶性) 目录 输出结果 设计思路 核心代码 输出结果 设计思路 核心代码 X_train = np.float32 ...

  4. sklearn基础篇(三)-- 鸢尾花(iris)数据集分析和分类

    后面对Sklearn的学习主要以<Python机器学习基础教程>和<机器学习实战基于scikit-learn和tensorflow>,两本互为补充进行学习,下面是开篇的学习内容 ...

  5. 线性可分支持向量机记录

    这里是引用 前言 小那近日因为工作需要,详细看了支持向量机的学习算法是如何玩转分类功能的.在程序员女朋友的无数次推荐下,青睐于手写笔记的小那开启了博客记录之行.这篇内容主要讲述了支持向量机的3种类别种 ...

  6. 统计学习方法笔记(五)-线性可分支持向量机原理及python实现

    支持向量机 支持向量机 线性可分支持向量机 最大间隔法 代码实现 案例地址 支持向量机 支持向量机(support vector machines,SVM)是一种二分类模型,它的基本类型是定义在特征空 ...

  7. 支持向量机鸢尾花Iris数据集的SVM线性分类练习

    支持向量机&鸢尾花Iris数据集的SVM线性分类练习 摘要 一.SVM基础 1.三种支持向量机 2.非线性支持向量机 二.鸢尾花实例 1.认识鸢尾花 2.鸢尾花实例演示 3.使用多项式特征和核 ...

  8. 【统计学习方法】朴素贝叶斯对鸢尾花(iris)数据集进行训练预测

    本文摘要 · 理论来源:[统计学习方法]第三四章 朴素贝叶斯 · 技术支持:pandas(读csv).numpy.sklearn.naive_bayes.GaussianNB(高斯朴素贝叶斯模型).s ...

  9. ML之SVM:基于SVM(sklearn+subplot)的鸢尾花iris数据集的前两个特征(线性不可分的两个样本),判定鸢尾花是哪一种类型

    ML之SVM:基于SVM(sklearn+subplot)的鸢尾花iris数据集的前两个特征(线性不可分的两个样本),判定鸢尾花是哪一种类型 目录 输出结果 实现代码 输出结果 (1).黄色的点为支持 ...

最新文章

  1. Postgresql:INSERT INTO ON CONSTRAINT pk_key_id do nothing
  2. 英特尔在网络营销之下即将出现大动作,第二季度服务器出货率将有所提升
  3. lduan HyPer-V 虚拟机服务监控及更新(十一)
  4. oracle存储过程深入,深入了解oracle存储过程的优缺点
  5. Java LinkedList公共对象peek()方法(带示例)
  6. application terminated怎么解决_优雅解决 SpringBoot 工程中多环境下 application.properties 的维护问题...
  7. 计算机基础第五章知识,计算机基础第5次作业-第五章-Powerpoint知识题
  8. 只需10行代码就让你的U盘变成纯净版winPE系统安装启动盘
  9. C语言入门--状态机编程
  10. 密码编码学与网络安全学习笔记
  11. 凡泰极客:远程办公,你礼貌吗?
  12. 开博尔android播放器,高端安卓播放器的选择——开博尔Q10Plus 二代 4K高清播放器...
  13. 微信小程序:二维码DIY背景美化生成器
  14. 怎么看电脑支持多少兆网速_怎么看电脑网卡多少兆_如何查看网卡多少兆-系统城...
  15. 一顿操作猛如虎!甲骨文是如何从老大干到老二的?
  16. PostgreSQL DBA(81) - Locks(FOR UPDATE SKIP LOCKED)
  17. vs2019创建EF的时候 系统找不到指定的路径
  18. 大工21春《船舶制图》大作业离线作业
  19. 【Linux】进程间通信(学习复习兼顾)
  20. Python 爬取 13 个旅游城市,告诉你五一大家最爱去哪玩?

热门文章

  1. 学习完Ajax的总结
  2. java 判断当前运行的操作系统
  3. RDKit | 基于RDKit的SMILES转canonical SMILES
  4. Survey | 基于图卷积网络的药物发现方法
  5. Latex 参考文献,或者最后一页平衡
  6. CentOS 8 已是绝版?还有后续么?
  7. iMeta:德布鲁因图在微生物组研究中的应用(全文翻译,PPT,视频)
  8. 宏基因组、微生物、环境杂志影响因子(IF)及变化分析
  9. 宏基因组合种华山松、云杉专车3天领证
  10. 我有个师兄,毕业后投身了学术自媒体行业