发布时间:2020-12-23 16: 50: 30
IBM SPSS Statistics探索性分析是描述统计中的一种分析方法,提供了数据过滤、离群值识别、假设检验等分析功能。
探索性分析中比较常用的功能是,通过数据过滤的功能,如分析数据中的极值、平均值、方差等,识别数据中的异常值;或使用检验的方法,判断后续使用的统计分析方法是否合适等,比如数据的正态分布假设是否成立。
一、示例数据
本文中,我们将会分析一组包含性别、客单价的数据。
通过探索性分析,查看数据中是否存在一些异常值,以及检验不同性别的客单价数据是否符合正态分布。
为什么要检验数据是否正态分布?这是因为在一些相关性分析(或其他分析)中,是以数据正态分布为前提进行统计分析的,如果数据不满足正态分布的假设,分析得出的结果就会不准确。
二、应用探索性分析
如图2所示,我们先打开IBM SPSS Statistics的探索分析选项(分析-描述统计-探索),然后再逐步演示操作。
1、选择变量
如图3所示,探索分析设置面板中的选项含义如下:
1. 因变量列表,即随自变量变化的数值,本例中选取客单价作为因变量
2. 因子列表,用于定义个案组,可选择一个或多个因子变量,本例中选取性别
3. 个案标注依据,用于标记个案,本例中选取账号
通过以上的设置,我们将会获取到不同性别客单价的探索性分析结果。
2、应用统计分析
完成变量的选择后,单击右侧的统计,开启如图4所示的统计面板,其中的数值应用如下:
1. 描述,提供了平均值、中位数、方差、最大值、偏度等统计数值,可设置平均值的置信区间
2. M-估计量,为每个个案的数值应用权重,有助于减少极端值、异常值对平均值和中位数的影响
3. 离群值,即极值的分析,包含最大值、最小值
4. 百分位数,可将排序后的数据进行指定百分位值分组
本例中,我们选取了描述、M-估计值与离群值的数值。
3、解读统计分析结果
从分析结果来看,如图5所示,当前数据包含了50个男性客单价个案,以及49个女性客单价个案。
如图6所示,从描述数据可以看到,男性的客单价平均值为100.8,而女性客单价平均值仅为47.6
而男性客单价平均值的95%置信区间上限中,平均值达到188,说明存在一些极端值,进一步查看最大值数据,发现最大值达到2000。
这个最大值2000是单个个案,还是多个个案呢?另外,除了最大值外,是否存在其他极端值。为了解答以上问题,我们可以进一步查看极值分析。
如图7所示,可以看到,男性客单价中,账号77与账号85的客单价都属于极端值。
为了避免这些极值的影响,我们可以查看M估计量。如图8所示,经过M估计量的加权后,男性客单价平均值就变得比较正常了。
综上所示,通过IBM SPSS Statistics探索性分析的描述性统计数值,可获取到数据的平均值、极值等统计数值,有助于检查数据中的异常值情况。
另外,在《应用SPSS探索性分析,检验数据的正态分布》一文中,将会继续介绍探索性分析中的检验正态性功能。如需获取下一节内容,可前往IBM SPSS Statistics中文网站。
作者:泽洋
展开阅读全文
︾
微信公众号
读者也喜欢这些内容:
spss检验正态分布的标准 spss检验正态分布的操作步骤
正态分布是一种重要的统计分布,被应用于假设检验、回归分析等各种统计方法中。IBM SPSS Statistics作为一种强大的统计分析软件,提供了多种工具来检验数据是否符合正态分布。今天本文会为您讲解“spss检验正态分布的标准 spss检验正态分布的操作步骤”这两个问题,为您解读SPSS检验正态分布的标准、操作步骤以及如何解读检验结果。...
阅读全文 >
SPSS如何剔除无用数据 SPSS怎样剔除缺失值
SPSS是一款受众范围非常广的数据统计软件,也是一款非常人性化的软件。SPSS不仅在功能上能够满足用户对数据分析的需求,还能够帮助用户对数据资料进行筛选清理。下面给大家详细讲解,SPSS如何剔除无用数据,以及SPSS怎样剔除缺失值。...
阅读全文 >
spss多元回归分析怎么操作 spss多元回归分析数据解读
多元线性回归用来分析多个变量间是否存在相关关系。多元线性回归分析应用领域较广,如医学,体育学,社会学等。借助SPSS统计软件,我们可以非常简便的完成多元回归分析。关于SPSS多元回归分析怎么操作,SPSS多元回归分析数据如何解读,结合实例,本文向大家作简单介绍。...
阅读全文 >
spss因子分析是干嘛的 spss因子分析详细步骤
spss因子分析是干嘛的,因子分析是用来提取公共因子,当研究问题的变量比较多时,通过spss因子分析可用较少变量去综合解释原有的多个变量。本文会以实际的例子演示spss因子分析详细步骤,以及进行结果的解读。...
阅读全文 >