描述统计计算说明
提示:本指南只针对描述统计特有的内容进行描述,关于软件的通用操作流程(如文件上传、参数设置、结果下载等),请查看:通用计算说明
1. 方法概述
描述统计用于汇总数值变量的集中趋势、离散程度、分位数和分布形态,是后续相关分析、差异检验、回归建模前的基础步骤。本工具会自动识别文件中至少包含 3 个有效数值的变量,并输出均值、标准差、分位数、偏度、峰度等常用指标。
特别提醒: 分类文本列不会参与计算;空白单元格按缺失处理,不计入有效样本量。
2. 计算步骤
2.1 分析原理
对每个数值变量的有效观测值,计算:
- 集中趋势:均值、中位数
- 离散程度:标准差、方差、极差、四分位距相关分位数
- 位置统计:最小值、Q1、Q3、最大值
- 分布形态:偏度、峰度
- 精度指标:标准误
标准差 $s$ 与方差 $s^2$ 采用样本公式(分母为 $n-1$,即无偏估计),而不是总体公式(分母为 $n$)。其中 $n$ 为该变量的有效样本量(有效N)。
2.2 数据文件格式
描述统计需要上传第一行为变量名的 Excel 文件。
文件格式要求:
- 第一行为变量名称
- 数据区以数值变量为主
- 每个数值变量至少需要 3 个有效数值,否则不会进入结果
- 空白单元格记为缺失,不参与该变量的统计量计算
数据示例:
| 年龄 | 月收入(元) | 综合评分 | 工作年限(年) | 周工作时长(小时) |
|---|---|---|---|---|
| 28 | 7600 | 82.5 | 4.0 | 40.0 |
| 35 | 9200 | 76.0 | 8.5 | 45.0 |
| 31 | 79.5 | 6.0 | 42.0 | |
| 40 | 11000 | 88.0 | 12.0 | 48.0 |
页面可直接下载示例文件 描述统计示例.xlsx 作为模板。
2.3 参数设置
描述统计无需额外参数。系统会自动筛选并分析全部适用的数值变量。
2.4 计算结果
2.4.1 描述统计结果表
| 字段 | 含义 |
|---|---|
| 变量 | 变量名 |
| 有效N | 非缺失样本量 |
| 缺失N | 缺失样本量 |
| 均值 | 算术平均数 |
| 标准差 | 样本标准差 |
| 方差 | 样本方差 |
| 最小值 / Q1 / 中位数 / Q3 / 最大值 | 位置与分位数 |
| 极差 | 最大值 − 最小值 |
| 偏度 | 分布偏斜程度;接近 0 更接近对称 |
| 峰度 | 分布峰态;与正态对照时用于观察尾部厚薄 |
| 标准误 | 均值的标准误 |
2.4.2 结果解读建议
- 均值与中位数接近,通常说明分布较对称;相差较大时需警惕偏态或异常值
- 标准差、极差越大,数据离散程度越高
- 偏度、峰度主要用于观察形态,正式判断是否正态请使用“正态性检验”
- 若缺失N较高,建议先做“缺失值处理”,再解释描述统计结果
2.5 结果下载
下载文件包含“描述统计结果”工作表,可直接用于论文附表或报告。
3. 注意事项
- 只有能转换为数值、且有效值不少于 3 个的列才会被分析。
- 若某列混有大量文本,转换失败的单元格会变成缺失,可能显著减少有效N。
- 描述统计不删除异常值;若怀疑极端值影响均值,可先做“异常值检验”。
- 试用版仅支持使用示例文件计算。