文章首发于微信公众号《有三AI》

【AI白身境】深度学习中的数据可视化

今天是新专栏《AI白身境》的第八篇,所谓白身,就是什么都不会,还没有进入角色。

上一节我们已经讲述了如何用爬虫爬取数据,那爬取完数据之后就应该是进行处理了,一个很常用的手段是数据可视化。

通过数据可视化,可以更加直观地表征数据,在深度学习项目中,常需要的数据可视化操作包括原始图片数据的可视化,损失和精度的可视化等。

作者 | 言有三 臧小满

编辑 | 言有三 臧小满

01 什么是数据可视化?

每每提到数据可视化,大家脑中可能会浮现很各种图表、西装革履的分析师、科幻大片中酷炫的仪表。

其实不用那么复杂,数据可视化早就融合进你我的生活,地铁线路图、公交时刻表,天气预报中的气象地图等都是很常见的。

为什么要进行可视化?

因为人是视觉动物,对于图像的敏感度要比对纯数字的敏感度高的多。

人类对图像的处理速度比文本快6万倍,同时人类右脑记忆图像的速度比左脑记忆抽象文字快100万倍。数据可视化正是利用人类天生技能来增强数据处理和组织效率。

举个简单的例子,计划买一套房产作为投资, 想要了解“去年上海房价哪里涨幅最大”,现以图作答, 把去年的增长率体现在图上,以20%作为分界, 增长超过20%的标红色, 超过越多则越大, 不足的标记成蓝色, 如下图,可以很快get到哪个区域的大幅度涨幅。

可视化将数字抽象成了更方便我们观察和感受的图表,因此需要熟悉使用。

02 低维数据可视化

数据有不同的维度,我们最常接触的就是一维,二维的数据,在机器学习任务中,包括损失函数等统计指标。

2.1 散点图

散点图,常用于分析离散数据的分布。比如我们有一个数据集,里面的图片有不同的大小,我们可以利用x,y轴分别对应图片的宽高,从而画出图片尺度的空间分布情况。越密集的地方,说明该尺度类型的图越多,如下图所示。

2.2 折线图

折线图是用于分析变量随另一个变量的变化关系,我们平常接触最多的loss曲线图,accuracy曲线图就是这一种,可以看指标随着训练过程的变化判断收敛情况,从而推测模型训练的好坏,折线图被广泛应用于各类分析,如下图所示。

2.3 直方图,饼状图

这两种图,都常用于统计数据的分布比例以及响应幅度,比如一幅图片的亮度分布情况,不同网络层的参数量,计算时间代价。

这几种图,适合对有时序变化的一维向量,有统计分布的一维向量,或者二维图像的尺度等信息进行可视化。

03 高维数据可视化

在机器学习任务中,数据通常是用成百上千维的向量表示,而超过3维的向量,就已经超过了人类的可视化认知,因此通常需要对数据进行降维。

数据降维方法可以分为线性方法和非线性方法。其中线性方法包括PCA和LDA,而非线性方法有保留局部特征、基于全局特征等方法,以t-SNE为代表。下面我们主要介绍PCA和t-SNE方法。

3.1  PCA降维

PCA,全称是Principal components analysis,这是一种分析、简化数据集的技术。PCA常用于减少数据集的维数,同时保持数据集中对方差贡献最大的特征,原理是保留低阶主成分,忽略高阶主成分,因为低阶成分保留了数据最多的信息

假定X是原始数据,Y是降维后的数据,W是变换矩阵,Y=XW。假如我们需要降到3 维以便于我们可视化,那就取Y的前三个主成分作为原始属性X的代表。

我们采用Google开源的网页版数据可视化工具Embedding Projector来进行可视化,链接如下:

http://projector.tensorflow.org/

选择MNIST作为可视化例子,它的原始维度为10000×784,即10000张28×28的图像。

利用这个工具我们进行PCA的可视化,降低到3个维度后,我们可以选择某个数字进行可视化。下图就是数字9的分布,可以看到,总共有1009个样本,数据的分布在物理空间上具有一定的聚类特性。

还可以用不同的颜色查看全体数据的分布,从这里可以更好的看出不同类的分布规律。

3.2  t-SNE降维

SNE全称是Stochastic Neighbor Embedding,它将数据点之间高维的欧氏距离转换为表示相似度的条件概率,目标是将高维数据映射到低维后,尽量保持数据点之间的空间结构,从而那些在高维空间里距离较远的点,在低维空间中依然保持较远的距离。

t-SNE即t-distributed stochastic neighbor embedding,t-SNE用联合概率分布替代了SNE中的条件概率分布,解决了SNE的不对称问题。通过引入t分布,解决了同类别之间簇的拥挤问题。

t-SNE方法实质上是一种聚类的方法,对于一个空间中的点,周围的其他点都是它的“邻居”,方法就是要试图使所有点具有相同数量的“邻居”。

t-SNE经过学习收敛后,通过投影到2维或者3维的空间中可以判断一个数据集有没有很好的可分性,即是否同类之间间隔小,异类之间间隔大。如果在低维空间中具有可分性,则数据是可分的,如果不具有可分性,可能是数据不可分,也可能仅仅是因为不能投影到低维空间。

下图是t-SNE可视化结果图,可以看出,数字都有很明显的聚类效果。

在进行一个机器学习任务之前,通过可视化来对数据集进行更深刻的认识,有助于预估任务的难度,在遇到困难后也会更加容易找到解决方案。

04 python数据可视化项目

考虑到python是第一大机器学习编程语言,同时开源项目居多,所以我们只关心python相关的工具,而且python也基本可以满足需求。

可视化的项目太多了,下面基于python和GitHub的数据,随便推荐几款。

1. tensorboard和tensorboardX,想必不需要多做介绍,后者大家可能不熟悉,被开发用来支持chainer, mxnet,numpy,4000+star。

https://github.com/lanpa/tensorboardX

2. visdom,支持numpy和torch的工具,常用于pytorch数据可视化,很强大,5000+star。

https://github.com/facebookresearch/visdom

3. seaborn:一款基于matplotlib的工具,简单来说,就是有更高的API,画出的图也好看,5000+star,主要处理低维数据。

https://github.com/mwaskom/seaborn

4. holoviews:很酷炫的工具,与season差不多,1000+star。

https://github.com/ioam/holoviews

5. missingno:一款缺失数据可视化工具,非常适合分析数据集的完整性,1000+star。

https://github.com/ResidentMario/missingno

就这么多,以后再集中讲可视化工具。

总结

数据可视化抽象了数据本身真正的价值,熟练掌握可视化对于分析数据的特征和深度学习模型的性能是必要的技能。

下期预告:下一期我们讲入行AI必备的数学基础,如果你有建议,欢迎留言,我们会及时采纳的。

转载文章请后台联系

侵权必究

AI白身境系列完整阅读:

第一期:【AI白身境】深度学习从弃用windows开始

第二期:【AI白身境】Linux干活三板斧,shell、vim和git

第三期:【AI白身境】学AI必备的python基础

第四期:【AI白身境】深度学习必备图像基础

第五期:【AI白身境】搞计算机视觉必备的OpenCV入门基础

第六期:【AI白身境】只会用Python?g++,CMake和Makefile了解一下

第七期:【AI白身境】学深度学习你不得不知的爬虫基础

第八期: 【AI白身境】深度学习中的数据可视化

第九期:【AI白身境】入行AI需要什么数学基础:左手矩阵论,右手微积分

第十期:【AI白身境】一文览尽计算机视觉研究方向

第十一期:【AI白身境】AI+,都加在哪些应用领域了

第十二期:【AI白身境】究竟谁是paper之王,全球前10的计算机科学家

AI初识境系列完整阅读

第一期:【AI初识境】从3次人工智能潮起潮落说起

第二期:【AI初识境】从头理解神经网络-内行与外行的分水岭

第三期:【AI初识境】近20年深度学习在图像领域的重要进展节点

第四期:【AI初识境】激活函数:从人工设计到自动搜索

第五期:【AI初识境】什么是深度学习成功的开始?参数初始化

第六期:【AI初识境】深度学习模型中的Normalization,你懂了多少?

第七期:【AI初识境】为了围剿SGD大家这些年想过的那十几招

第八期:【AI初识境】被Hinton,DeepMind和斯坦福嫌弃的池化,到底是什么?

第九期:【AI初识境】如何增加深度学习模型的泛化能力

第十期:【AI初识境】深度学习模型评估,从图像分类到生成模型

第十一期:【AI初识境】深度学习中常用的损失函数有哪些?

第十二期:【AI初识境】给深度学习新手开始项目时的10条建议

感谢各位看官的耐心阅读,不足之处希望多多指教。后续内容将会不定期奉上,欢迎大家关注有三公众号 有三AI

【AI白身境】深度学习中的数据可视化​​​​​​​相关推荐

  1. 对pca降维后的手写体数字图片数据分类_【AI白身境】深度学习中的数据可视化...

    今天是新专栏<AI白身境>的第八篇,所谓白身,就是什么都不会,还没有进入角色. 上一节我们已经讲述了如何用爬虫爬取数据,那爬取完数据之后就应该是进行处理了,一个很常用的手段是数据可视化. ...

  2. 【AI白身境】深度学习中的数据可视化

    今天是新专栏<AI白身境>的第八篇,所谓白身,就是什么都不会,还没有进入角色. 上一节我们已经讲述了如何用爬虫爬取数据,那爬取完数据之后就应该是进行处理了,一个很常用的手段是数据可视化. ...

  3. 【AI白身境】学深度学习你不得不知的爬虫基础​​​​​​​

    文章首发于微信公众号<有三AI> [AI白身境]学深度学习你不得不知的爬虫基础 今天是新专栏<AI白身境>的第七篇,所谓白身,就是什么都不会,还没有进入角色. 对于深度学习,一 ...

  4. 【AI白身境】只会用Python?g++,CMake和Makefile了解一下​​​​​​​

    文章首发于微信公众号<有三AI> [AI白身境]只会用Python?g++,CMake和Makefile了解一下 今天是新专栏<AI白身境>的第六篇,所谓白身,就是什么都不会, ...

  5. 【AI白身境】搞计算机视觉必备的OpenCV入门基础

    文章首发于微信公众号<有三AI> [AI白身境]搞计算机视觉必备的OpenCV入门基础 今天是新专栏<AI白身境>的第五篇. 曾经看过一个视频,树莓派自平衡机器人自动追着小球跑 ...

  6. 【AI白身境】学AI必备的python基础​​​​​​​

    文章首发于微信公众号<有三AI> [AI白身境]学AI必备的python基础 今天是新专栏<AI白身境>的第三篇,所谓白身,就是什么都不会,还没有进入角色. 上一篇给大家介绍了 ...

  7. 【AI白身境】Linux干活三板斧,shell、vim和git

    文章首发于微信公众号<与有三学AI> [AI白身境]Linux干活三板斧,shell.vim和git 今天是专栏<AI白身境>的第二篇,所谓白身,就是什么都不会,还没有进入角色 ...

  8. 【AI白身境】计算机视觉都有哪些研究方向

    文章首发于微信公众号<有三AI> [AI白身境]一文览尽计算机视觉研究方向 今天是新专栏<AI白身境>的第10篇,所谓白身,就是什么都不会,还没有进入角色. 相信看了前面的几篇 ...

  9. 【AI白身境】究竟谁是paper之王,全球前10的计算机科学家

    文章首发于微信公众号<有三AI> [AI白身境]究竟谁是paper之王,全球前10的计算机科学家 今天是新专栏<AI白身境>的第十二篇,也是最后一篇了,作为最后一篇,我的想法是 ...

最新文章

  1. Android 导入项目时出现错误的解决方法(红色感叹号)
  2. Bi-level error correction for PacBio long reads
  3. ZJOI 2017 线段树
  4. netcore开发windows普通服务(非Web)并一键发布到服务器
  5. 【强化学习】Policy Gradient原理
  6. GIS实战应用案例100篇(一)-GEE主成分分析(含代码)
  7. oracle flashback 深入研究,oracle 之flashback 深入研究。
  8. mac os11以下安装Xcode
  9. Linux下监控网卡流量的软件iftop
  10. 知识蒸馏 | 知识回顾
  11. 市场调研报告-全球与中国商业虚拟化平台市场现状及未来发展趋势
  12. 信号越多越好?随机相对强弱指数 vs. 相对强弱指数
  13. iscc_2018 web题解
  14. 小学生的搞笑考试卷子
  15. Unity教程 | 手把手教你拼一个3D“魔方”
  16. 组合数学4-全排列生成算法
  17. Java 12 / JDK 12 正式发布
  18. Vue3+ElementPlus网页端聊天|vue3.0仿微信/QQ界面实例
  19. 梯形断面临界水深莫洛图
  20. 高手怎么抓热点,每天几点操作?

热门文章

  1. java11正式发布了,让java代码更完美
  2. springIllegalArgumentException Can not set field to $Proxy 在spring中使用事物或AOP遇到的错误
  3. (Spring)使用注解开发
  4. Java实现图的深度和广度优先遍历算法
  5. 使用C语言链表创建学生信息并且将信息打印输出
  6. SpringBoot快速集成kafka
  7. 使用nginx解决跨域问题
  8. Spring Cloud(三) 熔断器Hystrix
  9. android java 圆角_java – Android:给一个webview圆角?
  10. java 命令 乱码_解决java 命令行乱码的问题