本文对应《R语言实战》第14章:主成分和因子分析

主成分分析(PCA)是一种数据降维技巧,它能将大量相关变量转化为一组很少的不相关变量,这些无关变量成为主成分。

探索性因子分析(EFA)是一系列用来发现一组变量的潜在结构的方法。通过寻找一组更小的、潜在的或隐藏的结构来解释已观测到的、显式的变量间的关系。

这两种方法都需要大样本来支撑稳定的结果,但是多大是足够的也是一个复杂的问题。目前,数据分析师常使用经验法则:因子分析需要5~10倍于变量数的样本数。另外有研究表明,所需样本量依赖于因子数目、与各因子相关联的变量数,以及因子对变量方差的解释程度。

基础安装包里有princomp()函数可以做主成分分析,factanal()函数可以做因子分析。

另外有psych包,提供以下函数:

函数

描述

principal()

含多种可选的方差旋转方法的主成分分析

fa()

可用主轴、最小残差、加权最小平方或最大似然法估计的因子分析

fa.parallel()

含平行分析的碎石图

factor.plot()

绘制因子分析或主成分分析的结果

fa.diagram()

绘制因子分析或主成分的载荷矩阵

scree()

因子分析和主成分分析的碎石图

主要步骤:

  1. 数据预处理

    需要确保数据中没有缺失值

  2. 选择因子模型

    判断是PCA(数据降维)还是EFA(发现潜在结构)更符合你的研究目标。如果选择EFA方法,还需要选择一种估计因子模型的方法(如最大似然估计)

  3. 判断要选择的主成分/因子数目

  4. 选择主成分/因子

  5. 旋转主成分/因子

  6. 解释结果

  7. 计算主成分或因子得分

=========================================================================

主成分分析:

PCA的目标是用一组较少的不相关变量代替大量相关变量,同时尽可能保留初始变量的信息,这些推导所得的变量成为主成分,它们是观测变量的线性组合。各主成分互相正交。

判断主成分的个数准则:

  1. 根据先验经验和理论知识判断主成分数
  2. 根据要解释变量方差的积累值的阈值来判断需要的主成分数
  3. 通过检查变量间k*k的相关系数矩阵来判断保留的主成分数

最常见的是基于特征值的方法。每个主成分都与相关系数矩阵的特征值相关联,第一主成分与最大的特征值相关联,第二主成分与第二大的特征值相关联,依次类推。Kaiser-Harris准则建议保留特征值大于1的主成分,因为特征值小于1的成分所解释的方差比包含在单个变量中的方差更少。Cattell碎石检验则绘制了特征值与主成分数的图形。这类图形可以清晰地展示图形弯曲状况,在图形变化最大处之上的主成分都可以保留。最后,还可以进行模拟,依据与初始矩阵相同大小的随机数据矩阵来判断要提取的特征值。若基于真实数据的某个特征值大于一组随机数据矩阵相应的平均特征值,那么该主成分可以保留。这种方法称为平行分析。

#展示基于观测特征值的碎石检验(线段与x符号组成)、根据100个随机数据矩阵推导出来的特征值均值(虚线),以及大于1的特征值准则(y=1的水平线)
library(psych)
fa.parallel(USJudgeRatings[, -1], fa = “PC”, n.iter = 100, show.legend = FALSE,
main = “Scree plot with parallel analysis”)

  

提取主成分:

principal(r, nfactors = , rotate = , scores = )

其中r是相关系数矩阵或原始数据矩阵;

nfactors设定主成分数(默认为1);

rotate指定旋转的方法(默认为最大方差旋转,varimax);

scores设定是否需要计算主成分得分(默认不需要)。

输出解释:

PC1(或PC2…)栏包含了成分载荷,指观测变量与主成分的相关系数。可用来解释主成分的含义,是一个可用来进行一般性评价的维度。

h2栏指成分公因子方差:主成分对每个变量的方差解释度;

u2栏指成分唯一性(1-h2):方差无法被主成分解释的比例;

SS loadings行包含了与主成分相关联的特征值,指的是与特定主成分相关联的标准化后的方差值。

Proportion Var行表示的是每个主成分对整个数据集的解释程度。

主成分旋转:

当提取了多个成分时,对它们进行旋转可使结果更具解释性。

旋转是一系列将成分载荷变得更容易解释的数学方法,它们尽可能地对成分去噪。

旋转方法有两种:使选择的成分保持不相关(正交旋转);让它们变得相关(斜交旋转)。

最流行的正交旋转是方差极大旋转,它试图对载荷阵的列进行去噪,使得每个成分只是由一组有限的变量来解释(即载荷阵每列只有少数几个很大的载荷,其他都是很小的载荷)。(具体例子参见书305页)

由于最终目标是用一组较少的变量替换一组较多的相关变量,因此还需要获取每个观测在成分上的得分。

获取主成分得分的方法:

第一种情况是,只有一个主成分,此时设置score = TRUE即可得到主成分得分;

第二种情况是,基于相关系数矩阵的主成分分析,虽然原始数据不可用,但是可以得到用来计算主成分得分的系数。为了简化计算,通常将接近0的系数直接看作是0。

=========================================================================

探索性因子分析:

目标是通过发掘隐藏在数据下的一组较少的、更为基本的无法观测的变量,来解释一组可观测变量的相关性。这些虚拟的、无法观测的变量称作因子。(每个因子被认为可以解释多个观测变量间共有的方差,因此准确来说,它们应该称作公共因子)

同样的,需要判断需提取的公共因子数:

值得注意的是,当三种原则摇摆不定时,高估因子数通常比低估因子数的结果好。另外,Kaiser-Harris准则的特征值数大于0而不是1(图中的水平线)。

提取公共因子:

fa(r, nfactors = , n.obs = , rotate = , scores = , fm = )

r是相关系数矩阵或者原始数据矩阵;

nfactors设定提取的因子数(默认为1);

n.obs是观测数(输入相关系数矩阵时需要填写);

rotate设定旋转的方法(默认互变异数最小法);

scores设定是否计算因子得分(默认不计算);

fm设定因子化方法(默认极小残差法)。

提取公共因子的方法有很多,包括最大似然法(ml)、主轴迭代法(pa)、加权最小二乘法(wls)、广义加权最小二乘法(gls)和最小残差法(minres)。最大似然法有良好的统计性质,但是有时最大似然法不会收敛,此时采用主轴迭代法会有好效果。

因子旋转:

正交与斜交旋转,具体例子参考书310页。

两者不同之处:对于正交旋转,因子分析的重点在于因子结构矩阵(变量与因子的相关系数),而对于斜交旋转,因子分析会考虑三个矩阵:因子结构矩阵、因子模式矩阵和因子关联矩阵。

因子模式矩阵即标准化的回归系数矩阵,它列出了因子预测变量的权重。因子关联矩阵即因子相关系数矩阵。

因子结构矩阵(即因子载荷矩阵)一般不会列出来,但是可以计算得到,公式为F = P * Phi,其中F是因子载荷阵,P为因子模式矩阵,Phi为因子关联矩阵。(例子可以参考311页)

因子得分:

相比PCA,EFA并不那么关注计算因子得分。在fa()函数中添加score = TRUE即可得到因子得分。另外还可以得到得分系数(标准化的回归权重),它在返回对象的weights元素中。

其他与EFA相关的包:

FactoMineR: 提供PCA和FEA方法,潜变量模型,并有更多参数选项;

FAiR: 使用遗传算法估计因子分析模型,增强了模型参数的估计能力,能够处理不等式的约束条件;

GPArotation: 提供多种因子旋转方法;

nFactors: 提供了用来判断因子数目的许多复杂方法。

其他潜变量模型:

CFA(验证性因子分析)是结构方程模型(SEM)中的一种方法。SEM不仅可以假定潜在因子的数目以及组成,还能假定因子间的影响方式。可以将SEM看做是验证性因子分析(对变量)和回归分析(对因子)的组合,它的结果输出包含统计检验和拟合度的指标。具体实现方式有sem包,openMx包,lavaan包。

ltm包可以用来拟合测验和问卷中各项目的潜变量模型。

潜类别模型(潜在的因子被认为是类别型而非连续型)可通过FlexMix, lcmm, randomLCA, poLC包进行拟合。lcda包可做潜类别判别分析,lsa包可做潜在语义分析。

ca包提供了可做简单和多重对应分析的函数。

另外MDS(多维标度法)可以用来发现解释相似性和可测对象间距离的潜在维度。基础安装的cmdscale()函数可以实现经典MDS,MASS包里的isoMDS()函数可以做非线性MDS。

小结:

转载于:https://www.cnblogs.com/gyjerry/p/6481098.html

R语言实战(九)主成分和因子分析相关推荐

  1. 【R实验.9】主成分和因子分析

    解法并不单一,下列方法带有璇子个人的偏好,因此仅供参考.如有错误,欢迎在评论区斧正! 9.1 用主成分方法探讨城市工业主体结构.表 9-4 是某市工业部门十三个行业,分别是冶金 (1).电力(2).煤 ...

  2. R语言实战笔记--第十四章 主成分和因子分析

    R语言实战笔记–第十四章 主成分和因子分析 标签(空格分隔): R语言 主成分分析 因子分析 原理及区别 主成分分析与因子分析很接近,其目的均是为了降维,以更简洁的数据去解释结果,但这两种方法其实是相 ...

  3. 基于R语言的主成分和因子分析

    主成分分析 主成分分析,是一种降维的分析方法,其考察多个变量间相关性的一种多元统计方法,研究如何通过少数几个主成分来揭示多个变量间的内部结构,即从原始变量中导出少数几个主成分,使它们尽可能多地保留原始 ...

  4. 65 R 主成分与因子分析

    主成分与因子分析 1 概念 2 数学模型 3 相关性分析 4 R主成分分析 三种方法 4.1方法1 princomp 方法2 princomp 未标准化 方法3 用principal 函数对原数据进行 ...

  5. R 语言实战-Part 4 笔记

    R 语言实战(第二版) ## part 4 高级方法 -------------第13章 广义线性模型------------------ #前面分析了线性模型中的回归和方差分析,前提都是假设因变量服 ...

  6. R语言实战 第2版 中文目录

    封面 1 数字版权声明 2 作译者介绍 3 扉页 4 版权页 5 版权声明页 6 对第1版的赞誉 7 致谢 8 前言 10 关于本书 12 关于封面图片 17 目录 18 第一部分 入门 24 第1章 ...

  7. R语言实战(中文完整版)pdf

    下载地址:网盘下载 内容简介  · · · · · · 数据时代已经到来,但数据分析.数据挖掘人才却十分短缺.由于"大数据"对每个领域的决定性影响, 相对于经验和直觉,在商业.经济 ...

  8. 李倩星r语言实战_基于PCR的全球平均气温研究

    段晓鸣 [摘 要] 本文运用主成分回归的方法研究了全球平均气温与CO2,N2O,CFC.11,CFC.12,TSI,Aerosols六个自变量之间的关系,选取了自1983年5月到2008年12月的数据 ...

  9. R语言实战(七)图形进阶

    本文对应<R语言实战>第11章:中级绘图:第16章:高级图形进阶 基础图形一章,侧重展示单类别型或连续型变量的分布情况:中级绘图一章,侧重展示双变量间关系(二元关系)和多变量间关系(多元关 ...

最新文章

  1. Vue给Element UI的el-popconfirm绑定按钮事件
  2. 服务器dbback文件夹,怎么让SQL 2000定时复制备份数据库到局域网中的指定电脑上? - SQL Server论坛 - 51CTO技术论坛_中国领先的IT技术社区...
  3. Android JUnit测试说明和实例演示
  4. 首次公开!单日600PB的计算力--阿里巴巴EB级大数据平台的进击
  5. 无法解析的外部符号 _WinMain@16,该符号在函数 ___tmainCRTStartup 中被引用
  6. mysql 5.5.18下载_MySQL5.7.18下载和安装过程图文详解
  7. 面向机器学习的特征工程 一、引言
  8. 谷歌浏览器一进百度空间就崩溃的临时解决方法
  9. Win7平台下配置Sublime Text2 的C++编译环境
  10. 被玩坏的“网抑云音乐“可视化数据分析
  11. 网络共享计算机设置方法,如何设置网络共享(局域网共享如何设置)
  12. 2020计算机专业保研夏令营面经:中科院计算所网数机试题目
  13. 不朽的浪漫网站服务器,浪漫人族TOD专访 虫族强大让我震惊
  14. Kettle连接mysql 驱动报 Driver class ‘org.gjt.mm.mysql.Driver‘ could not be found, make sure the ‘MySQL‘..
  15. 纯CSS调整select选择框高度,兼容IE/Firefox/Opera/Safair/Chrome
  16. java实现HTTPS单向认证TLS指定加密套件(文章很详细,好文章!)
  17. 【STM32CubeMx你不知道的那些事】第十章:STM32CubeMx的SPI外置FLASH(W25Q128)+文件系统(FATFS)+虚拟U盘
  18. stm32固件库(STM32F10x标准外设库)V3.5简介
  19. BLOCK层代码分析(9)IO下发之IO下发
  20. 文本溢出显示省略号,鼠标浮动查看全部内容

热门文章

  1. linux内核编译系统调用,linux编译内核及添加系统调用
  2. 华为郑叶来:AI炒作和投机回落,是行业应用春天的开始
  3. java大数类阶乘_Java中的大数阶乘
  4. 2018ccpc吉林 C:JUSTICE
  5. 联通的营收比电信还少千亿,并且差距还越拉越大了
  6. 徐州初中计算机学校排名2015,徐州市十大重点初中排名
  7. android系列:第一篇 android开发常用命令集合,代码目录简介
  8. 个人电脑做外网服务器(一)
  9. vue实现table评分表
  10. 配置文件是用来解耦的吗_一次配置,随处运行:解耦配置和运行时