数据挖掘总结之主成分分析与因子分析
发布网友
发布时间:2022-04-20 00:08
我来回答
共1个回答
热心网友
时间:2023-10-21 14:10
数据挖掘总结之主成分分析与因子分析
主成分分析与因子分析
1)概念:
主成分分析概念:主成分分析是把原来多个变量划为少数几个综合指标的一种统计分析方法。主成分分析(PCA)是一种数据降维技巧,它能将大量相关变量转化为一组很少的不相关变量,这些无关变量称为主成分。
PCA的目标是用一组较少的不相关变量代替大量相关变量,同时尽可能保留初始变量的信息,这些推导所得的变量称为主成分,它们是观测变量的线性组合。
因子分析概念:探索性因子分析(EFA)是一系列用来发现一组变量的潜在结构的方法。通过寻找一组更小的、潜在的或隐藏的结构来解释已观测到的、显式的变量间的关系。进行EFA需要大量的样本,一般经验认为如何估计因子的数目为N,则需要有5N到10N的样本数目。
PCA/EFA 分析流程:
(1)数据预处理;PCA和EFA都是根据观测变量间的相关性来推导结果。用户可以输入原始数据矩阵或相关系数矩阵列到principal()和fa()函数中,若输出初始结果,相关系数矩阵将会被自动计算,在计算前请确保数据中没有缺失值;
(2)选择因子分析模型。判断是PCA(数据降维)还是EFA(发现潜在结构)更符合你的分析目标。选择EFA方法时,还需要选择一种估计因子模型的方法(如最大似然估计)。
(3)判断要选择的主成分/因子数目;
(4)选择主成分/因子;
(5)旋转主成分/因子;
(6)解释结果;
(7)计算主成分或因子得分。
2)、因子分析与主成分分析的区别
①原理不同
主成分分析基本原理:利用降维(线性变换)的思想,每个主成分都是原始变量的线性组合,且各个主成分之间互不相关。
因子分析基本原理:利用降维的思想,从数据中提取对变量起解释作用的少数公共因子(因子分析是主成分的推广,相对于主成分分析,更倾向于描述原始变量之间的相关关系)
②侧重点不同
主成分分析侧重“变异量”,主成分分析是原始变量的线性组合,得出来的主成分往往从业务场景的角度难以解释
因子分析更重视相关变量的“共变异量”,因子分析需要构造因子模型:EFA中的原始变量是公共因子的线性组合,因子是影响变量的潜在变量,目的是找到在背后起作用的少量关键因子,因子分析的结果往往更容易用业务知识去加以解释
③ 因子分析的评价结果没有主成分分析准确; 因子分析比主成分分析的计算工作量大
主成分分析:原始变量的线性组合表示新的综合变量,即主成分;
EFA和PCA的区别在于:PCA中的主成分是原始变量的线性组合,而EFA中的原始变量是公共因子的线性组合,因子是影响变量的潜在变量,变量中不能被因子所解释的部分称为误差,因子和误差均不能直接观察到。进行EFA需要大量的样本,一般经验认为如何估计因子的数目为N,则需要有5N到10N的样本数目。