缺失值处理计算说明
提示:本指南只针对缺失值处理特有的内容进行描述,关于软件的通用操作流程(如文件上传、参数设置、结果下载等),请查看:通用计算说明
1. 方法概述
缺失值处理用于分析数据缺失情况,并按设定规则生成处理后的数据集。完整流程包括:
- 缺失值识别:把空白、空格、“无”、自定义标记等识别为缺失
- 缺失汇总:按变量统计有效N、缺失N、缺失率
- 缺失处理:删除、统计量填补、顺序填充或线性插值
- 导出结果:输出分析表、处理记录和处理后数据
特别提醒: 删除与填补都会改变样本结构或数值分布,应结合缺失机制与研究背景选择方法,并在论文中说明处理策略。
2. 计算步骤
2.1 处理逻辑
2.1.1 缺失值识别
系统可按策略把以下内容识别为缺失:
| 策略 | 说明 |
|---|---|
| 空白单元格 | Excel 中真正的空值(默认开启) |
| 纯空格文本 | 仅包含空格的文本 |
| 文本“无” | 单元格内容为“无” |
| 自定义 | 用户指定的标记,如 NA、未知、-999 |
自定义标记请使用英文分号 ; 分隔,例如:NA;未知;-999。
2.1.2 处理方法
不处理
- 仅输出缺失分析结果,不改动数据
删除
- 删除含缺失值的行:任一一列缺失即删除该行
- 按行阈值删除:当一行缺失数量或缺失比例达到阈值时删除
- 按列阈值删除:当一列缺失数量或缺失比例达到阈值时删除
填充
- 数值与分类填充方法分开设置,可同时生效
- 数值变量:均值 / 中位数 / 固定值 / 线性插值 / 前向填充 / 后向填充 / 不处理
- 分类变量:众数 / 固定值 / 前向填充 / 后向填充 / 不处理
- 某一侧选“不处理”时,该类型变量保持原样
- 前向、后向填充按当前 Excel 行顺序传递最近有效值
- 线性插值仅对数值变量,在两端有效值之间插值
2.2 数据文件格式
缺失值处理需要上传第一行为变量名的 Excel 文件。
文件格式要求:
- 第一行为变量名称
- 可同时包含数值变量与分类变量
- 允许存在空白单元格和文本缺失标记
数据示例:
| 区域 | 客户等级 | 销售额(万元) | 满意度 | 备注 |
|---|---|---|---|---|
| 东部 | 中级 | 125.0 | 4 | 正常 |
| 中部 | 98.5 | 3 | 待复核 | |
| 西部 | 初级 | 5 | 无 | |
| 东部 | NA | 110.0 | 未知 |
页面可直接下载示例文件 缺失值处理示例.xlsx 作为模板。示例中包含空白、空格、“无”、NA、未知 等多种缺失形态。
2.3 参数设置
- 处理方法:不处理 / 删除 / 填充
- 删除规则(当选择删除时)
- 删除含缺失值的行
- 按行阈值删除
- 按列阈值删除
- 阈值类型与阈值(阈值删除时)
- 缺失数量或缺失比例
- 比例阈值范围为 0–1
- 数值填充方法(当选择填充时)
- 不处理 / 均值 / 中位数 / 固定值 / 线性插值 / 前向填充 / 后向填充
- 分类填充方法(当选择填充时)
- 不处理 / 众数 / 固定值 / 前向填充 / 后向填充
- 数值固定值 / 分类固定值(对应侧选择固定值时分别填写)
- 缺失值识别策略
- 可多选:空白单元格、纯空格文本、文本“无”、自定义
- 自定义缺失值
- 仅在勾选“自定义”时生效
2.4 计算结果
2.4.1 变量缺失汇总
| 字段 | 含义 |
|---|---|
| 变量 | 变量名 |
| 有效N | 非缺失样本量 |
| 缺失N | 缺失样本量 |
| 缺失率(%) | 缺失占比 |
结果摘要还会给出完整样本数和缺失单元格总数。
2.4.2 处理记录
| 字段 | 含义 |
|---|---|
| 处理范围 | 行 / 列 / 变量 / 全部数据 |
| 变量或规则 | 作用对象或删除规则 |
| 处理数量 | 影响的行数、列数或单元格数 |
| 处理说明 | 具体操作说明 |
2.4.3 处理后数据
当执行删除或填充后,下载结果中会包含“处理后数据”工作表:
- 填充产生的新值会以橙色底色高亮,便于核对
- 可用于后续描述统计、相关分析、差异检验等
2.5 结果解读建议
- 先看缺失率是否集中在少数变量;高缺失变量可能需要删列或重新收集。
- 若缺失与其他变量/组别有关,简单删除可能引入偏差。
- 均值/中位数填补会压缩方差;固定值填补可能制造虚假峰值。
- 前向、后向填充和线性插值依赖行顺序,只适合有明确时间序或逻辑序的数据。
3. 注意事项
- 数值与分类填充方法可分别配置并同时生效;均值、中位数、线性插值仅作用于数值变量,众数填补仅作用于分类变量。
- 阈值删除中,比例阈值请填写 0–1 之间的小数,例如 0.5 表示 50%。
- 自定义缺失值匹配前会先去掉首尾空格。
- 若选择“不处理”,结果仍会给出缺失汇总,但不会改写原始数据。
- 试用版仅支持使用示例文件计算。