描述统计计算说明

提示:本指南只针对描述统计特有的内容进行描述,关于软件的通用操作流程(如文件上传、参数设置、结果下载等),请查看:通用计算说明

1. 方法概述

描述统计用于汇总数值变量的集中趋势、离散程度、分位数和分布形态,是后续相关分析、差异检验、回归建模前的基础步骤。本工具会自动识别文件中至少包含 3 个有效数值的变量,并输出均值、标准差、分位数、偏度、峰度等常用指标。

特别提醒: 分类文本列不会参与计算;空白单元格按缺失处理,不计入有效样本量。

2. 计算步骤

2.1 分析原理

对每个数值变量的有效观测值,计算:

  • 集中趋势:均值、中位数
  • 离散程度:标准差、方差、极差、四分位距相关分位数
  • 位置统计:最小值、Q1、Q3、最大值
  • 分布形态:偏度、峰度
  • 精度指标:标准误

标准差 $s$ 与方差 $s^2$ 采用样本公式(分母为 $n-1$,即无偏估计),而不是总体公式(分母为 $n$)。其中 $n$ 为该变量的有效样本量(有效N)。

2.2 数据文件格式

描述统计需要上传第一行为变量名的 Excel 文件。

文件格式要求:

  • 第一行为变量名称
  • 数据区以数值变量为主
  • 每个数值变量至少需要 3 个有效数值,否则不会进入结果
  • 空白单元格记为缺失,不参与该变量的统计量计算

数据示例:

年龄 月收入(元) 综合评分 工作年限(年) 周工作时长(小时)
28 7600 82.5 4.0 40.0
35 9200 76.0 8.5 45.0
31 79.5 6.0 42.0
40 11000 88.0 12.0 48.0

页面可直接下载示例文件 描述统计示例.xlsx 作为模板。

2.3 参数设置

描述统计无需额外参数。系统会自动筛选并分析全部适用的数值变量。

2.4 计算结果

2.4.1 描述统计结果表

字段 含义
变量 变量名
有效N 非缺失样本量
缺失N 缺失样本量
均值 算术平均数
标准差 样本标准差
方差 样本方差
最小值 / Q1 / 中位数 / Q3 / 最大值 位置与分位数
极差 最大值 − 最小值
偏度 分布偏斜程度;接近 0 更接近对称
峰度 分布峰态;与正态对照时用于观察尾部厚薄
标准误 均值的标准误

2.4.2 结果解读建议

  • 均值与中位数接近,通常说明分布较对称;相差较大时需警惕偏态或异常值
  • 标准差、极差越大,数据离散程度越高
  • 偏度、峰度主要用于观察形态,正式判断是否正态请使用“正态性检验”
  • 若缺失N较高,建议先做“缺失值处理”,再解释描述统计结果

2.5 结果下载

下载文件包含“描述统计结果”工作表,可直接用于论文附表或报告。

3. 注意事项

  1. 只有能转换为数值、且有效值不少于 3 个的列才会被分析。
  2. 若某列混有大量文本,转换失败的单元格会变成缺失,可能显著减少有效N。
  3. 描述统计不删除异常值;若怀疑极端值影响均值,可先做“异常值检验”。
  4. 试用版仅支持使用示例文件计算。