逐步回归计算说明

提示:本指南只针对逐步回归特有的内容进行描述,关于软件的通用操作流程(如文件上传、参数设置、结果下载等),请查看:通用计算说明

1. 方法概述

逐步回归(Stepwise Regression)是一种自动选择自变量的多元线性回归方法。它通过逐步增加或删除自变量,建立"最优"的回归方程。

本软件提供三种逐步回归方法:向前法(Forward)、向后法(Backward)、逐步法(Stepwise),用户可根据研究需求选择合适的方法。

1.1 基本原理

逐步回归通过统计检验(通常是F检验或t检验)来决定变量的进入和删除,包含三种方法策略

  1. 向前法(Forward):从没有自变量开始,逐个引入对因变量影响最显著的变量,直到没有变量满足进入条件为止
  2. 向后法(Backward):从包含所有自变量开始,逐个删除不显著的变量,直到所有保留变量都显著为止
  3. 逐步法(Stepwise):结合向前法和向后法,每引入一个变量后重新检验已入选变量的显著性,既可以引入新变量,也可以删除已入选的不显著变量

1.2 主要应用场景

  • 变量筛选:从众多候选变量中筛选出显著影响因变量的变量
  • 模型简化:减少模型中的变量数量,提高模型的可解释性
  • 多重共线性处理:通过剔除相关变量降低多重共线性问题
  • 预测建模:构建简洁且预测效果好的回归模型

2. 数据准备

2.1 数据文件格式

逐步回归需要上传包含因变量和自变量的Excel文件。

数据格式要求:

  • 第一行:列名(变量名称)
  • 后续行:数据值
  • 所有数据必须为数值类型(不能包含文字、符号等非数值内容)
  • 至少包含2列数据(1个因变量 + 至少1个自变量)
  • 建议候选自变量数量较多(3个以上)

示例数据结构:

GDP 人口 投资 消费 教育 科技
100.5 50.2 30.1 45.3 12.5 8.3
105.3 51.0 32.5 47.8 13.2 9.1
110.8 51.8 35.2 50.1 14.0 9.8

2.2 数据质量要求

基本要求:

  • 数据完整,无缺失值或空白单元格
  • 所有变量为数值型数据
  • 样本量充足(建议样本数 > 自变量数 × 10)
  • 数据真实可靠,来源明确

注意事项:

  • 检查是否存在异常值或极端值
  • 确保自变量之间不存在严重的多重共线性
  • 因变量与自变量之间应存在线性关系

3. 参数设置

3.1 因变量选择

从数据中选择一列作为因变量(Y),其余列将自动作为候选自变量(X)。

选择原则:

  • 选择研究中需要预测或解释的变量
  • 确保该变量具有实际意义
  • 通常选择连续型变量

3.2 逐步方法选择

本软件提供三种逐步回归方法,可根据研究需求选择:

向前法(Forward):

  • 从无变量开始,逐步引入显著变量
  • 适合候选变量较多的情况
  • 计算速度快

向后法(Backward):

  • 从全部变量开始,逐步删除不显著变量
  • 适合对所有变量都感兴趣的情况
  • 能考虑变量的联合作用

逐步法(Stepwise): ⭐ 推荐

  • 双向筛选,既可引入也可删除变量
  • 最灵活,适合大多数情况
  • 能自动优化变量组合

3.3 显著性水平设置

进入显著性水平(Pin): 变量进入模型的P值阈值(默认0.05)

  • 数值越小,进入条件越严格
  • 建议范围:0.01-0.10

删除显著性水平(Pout): 变量从模型删除的P值阈值(默认0.10)

  • 数值越大,删除条件越宽松
  • 通常设置为 Pout > Pin

3.4 结果保留小数位

设置计算结果的小数位数,默认为3位。

可选范围: 1-10位

4. 绘图设置

逐步回归提供实际值与预测值的对比图,帮助直观评估最终模型效果。

<div style=“text-align: center;”> <img src=“/guide/figures/多元线性回归/图表预览.png” width=“1100” alt=“图表预览”> </div>

4.1 图形尺寸设置

图形宽度: 设置图表宽度(默认10)
图形高度: 设置图表高度(默认6)
图像DPI: 设置图像分辨率(默认300,范围100-300)

4.2 字体设置

标签字体: 选择坐标轴标签的字体

  • 宋体(默认)
  • 黑体
  • 微软雅黑
  • 楷体
  • 仿宋
  • Times New Roman
  • Arial

标签字体大小: 设置坐标轴标签的字号(默认15)
刻度字体大小: 设置坐标轴刻度的字号(默认12)

4.3 线型和颜色设置

实际值颜色: 设置实际值曲线的颜色(默认蓝色)
预测值颜色: 设置预测值曲线的颜色(默认红色)

实际值标记: 选择实际值的标记样式

  • 圆形 (o) - 默认
  • 方形 (s)
  • 三角形 (^)
  • 菱形 (D)
  • 星形 (*)

预测值标记: 选择预测值的标记样式(默认方形)

显示网格: 是否在图表中显示网格线(默认开启)

4.4 坐标轴标签

X轴标签: 设置X轴的标签文字(默认"样本")
Y轴标签: 设置Y轴的标签文字(默认"值")

4.5 图表预览与更新

设置完绘图参数后,点击应用并更新图表按钮即可实时预览图表效果,可以多次调整参数直到满意为止。

5. 计算结果

计算完成后,系统将生成包含以下内容的Excel结果文件:

5.1 最终模型回归分析结果表

<div style=“text-align: center;”> <img src=“/guide/figures/逐步回归/逐步回归分析结果.png” width=“1100” alt=“逐步回归分析结果”> </div>

展示最终筛选出的模型的完整回归分析结果,结果表包含以下列:

变量列:

  • 列出所有入选自变量和常数项

非标准化系数:

  • B:回归系数,表示自变量每变化一个单位,因变量的平均变化量
  • 标准误:系数的标准误差,用于计算t值

标准化系数:

  • Beta:标准化回归系数,用于比较不同自变量的相对重要性(消除了量纲影响)

检验统计量:

  • t:t统计量,用于检验回归系数是否显著
  • P:显著性水平,带星号标记

共线性诊断:

  • VIF:方差膨胀因子,用于检测多重共线性
    • VIF < 5:无共线性问题(严格标准)
    • VIF < 10:可接受(宽松标准)
    • VIF > 10:存在严重共线性
    • VIF = ∞:存在完全共线性

模型拟合度:

  • :决定系数,表示模型的拟合优度(0-1之间,越接近1越好)
  • 调整R²:考虑自变量个数的调整后决定系数

F检验:

  • F:F统计量及其显著性,用于检验整体回归模型是否显著

5.2 实际值与预测值对比表

<div style=“text-align: center;”> <img src=“/guide/figures/逐步回归/对比.png” width=“500” alt=“对比”> </div>

包含每个样本的:

  • 样本编号
  • 实际值:原始数据中的因变量值
  • 预测值:最终模型预测的因变量值
  • 残差:实际值与预测值的差(实际值 - 预测值)

5.3 实际值与预测值对比图

<div style=“text-align: center;”> <img src=“/guide/figures/多元线性回归/对比图.png” width=“800” alt=“实际值与预测值对比图”> </div>

对比图展示:

  • 蓝色圆圈线:实际值曲线
  • 红色方块虚线:预测值曲线
  • 两条曲线越接近,说明模型拟合效果越好

6. 结果解读

6.1 逐步过程解读

引入变量的顺序:

  • 通常首先引入对因变量影响最显著的变量
  • 后续引入的变量在控制已有变量的基础上仍显著

变量被删除的原因:

  • 引入新变量后,原有变量变得不再显著
  • 说明该变量的作用已被新变量覆盖或存在共线性

6.2 F检验解读

F检验的作用: 检验最终模型整体是否存在显著的线性关系

判断标准:

  • P < 0.01:在1%水平上显著,模型非常显著,拒绝"回归系数全为0"的原假设
  • P < 0.05:在5%水平上显著,模型显著
  • P < 0.1:在10%水平上显著,模型基本显著
  • P ≥ 0.1:模型不显著,可能不适合使用

示例解读:

经过逐步回归筛选后,F检验的显著性P值为0.000***,在1%水平上呈现显著性,拒绝回归系数为0的原假设,因此最终模型基本满足要求。

6.3 R²和调整R²解读

R²(决定系数):

  • 表示自变量能够解释因变量变异的比例
  • R² = 0.8 表示模型可以解释80%的因变量变异
  • 一般标准:
    • R² > 0.8:拟合效果很好
    • 0.5 < R² < 0.8:拟合效果较好
    • R² < 0.5:拟合效果一般

调整R²:

  • 考虑了自变量个数的影响,更适合比较不同模型
  • 逐步回归的调整R²通常较高,因为剔除了不显著变量
  • 调整R²通常小于R²

与全模型对比:

  • 逐步回归的R²可能略低于包含所有变量的全模型
  • 但调整R²可能更高,说明模型更优
  • 变量数量更少,模型更简洁易解释

6.4 回归系数解读

非标准化系数B:

  • 表示在其他变量不变的情况下,该自变量每增加1个单位,因变量的平均变化量
  • 保留了原始变量的量纲和单位

标准化系数Beta:

  • 消除了量纲影响,可用于比较不同自变量的相对重要性
  • |Beta|越大,说明该变量对因变量的影响越大

显著性检验:

  • 看P值和星号标记
  • 最终模型中的变量通常都应该显著(P < 设定的显著性水平)
  • 如果存在不显著变量,可能需要调整显著性水平设置

6.5 VIF共线性诊断

多重共线性: 指自变量之间存在高度相关关系,会导致:

  • 回归系数估计不稳定
  • 标准误增大
  • t检验失效
  • VIF值异常

逐步回归的优势:

  • 通过逐步筛选,可以自动剔除引起共线性的变量
  • 最终模型的VIF值通常较低

处理建议:

  • VIF > 10:虽然逐步回归已筛选,但仍存在严重共线性,建议:

    1. 调整显著性水平设置
    2. 强制删除共线性变量
    3. 使用岭回归(Ridge Regression)
  • VIF = ∞:存在完全共线性,必须处理

6.6 回归方程

系统会自动生成最终模型的回归方程,例如:

$$ GDP = 10.523 + 2.345 \times 人口 + 1.234 \times 投资 $$

使用方法:

  • 将新的自变量值代入方程,即可预测因变量值
  • 系数的正负号表示该变量对因变量的影响方向
  • 只包含经过筛选的显著变量

7. 方法选择建议

7.1 三种方法对比

本软件提供的三种逐步回归方法各有特点,应根据实际情况选择:

方法 起始状态 操作方式 适用场景 优点 缺点
向前法 无变量 逐步引入 变量多、计算资源有限 计算快 不能删除已入选变量
向后法 全部变量 逐步删除 变量适中、关注联合作用 考虑联合作用 初始共线性问题
逐步法 无变量 引入+删除 大多数情况 最灵活 计算量稍大

向前法(Forward):

  • 适用场景: 自变量数量较多(如>20个),计算资源有限
  • 优点: 计算速度快,每次只考虑一个新变量
  • 缺点: 一旦变量进入就不再删除,可能保留不必要的变量
  • 建议: 适合初步探索性分析

向后法(Backward):

  • 适用场景: 自变量数量适中(如10-15个),对所有变量都感兴趣
  • 优点: 能考虑变量的联合作用,避免遗漏重要组合
  • 缺点: 初始模型包含所有变量,可能存在严重共线性问题
  • 建议: 适合变量间相关性较低的情况

逐步法(Stepwise):推荐使用

  • 适用场景: 大多数实际研究情况
  • 优点: 既能引入新变量,也能删除不显著变量,最灵活
  • 缺点: 计算量稍大,极少数情况下可能出现循环
  • 建议: 作为首选方法,综合效果最好

7.2 显著性水平设置

Pin(进入显著性水平):

  • 0.05(推荐):标准水平,确保引入的变量足够显著
  • 0.10:较宽松,可能引入更多变量
  • 0.01:严格水平,只引入非常显著的变量

Pout(删除显著性水平):

  • 0.10(推荐):标准设置,通常 Pout > Pin
  • 0.15:更宽松,较少删除变量
  • 0.05:较严格,等于Pin时相当于不删除已引入的变量

建议: Pout应略大于Pin(如Pin=0.05, Pout=0.10),以保证模型的稳定性

8. 常见问题

8.1 三种方法应该选择哪一个?

最常见的选择:

  • 首选逐步法(Stepwise):适合90%以上的实际应用场景
  • 逐步法结合了向前法和向后法的优点,既能引入新变量,也能删除不显著变量

特殊情况:

  • 变量特别多(>30个):选择向前法,计算更快
  • 样本量有限且想考虑所有变量的联合作用:选择向后法
  • 不确定用哪个:直接选择逐步法,这是最稳妥的选择

三种方法结果会一样吗?

  • 通常不完全一样,但相差不大
  • 最终模型的R²和主要变量通常相似
  • 如果三种方法结果差异很大,说明数据可能存在问题(如严重共线性)

8.2 为什么某个重要变量没有进入模型?

可能原因:

  1. 多重共线性: 该变量与已进入的变量高度相关,其作用已被其他变量代替
  2. 显著性水平设置过严: Pin设置过小(如0.01),调高Pin值试试
  3. 样本量不足: 增加样本量可能使该变量变得显著
  4. 变量关系非线性: 考虑变量转换或非线性模型
  5. 选择的方法不合适: 尝试换用其他方法(如改用向后法或逐步法)

8.3 逐步回归结果不稳定?

表现:

  • 重复运行得到不同结果
  • 或者提示无法收敛

解决方法:

  1. 更换逐步方法: 如果向前法不稳定,尝试向后法或逐步法
  2. 调整显著性水平: 适当放宽或收紧Pin和Pout
  3. 检查数据质量: 排查异常值和缺失值
  4. 增加样本量: 确保样本量足够
  5. 减少候选变量: 基于理论先行筛选变量
  6. 检查共线性: 计算变量间相关系数,手动剔除高度相关的变量

8.4 所有变量都进入了模型?

可能原因:

  • Pin设置过大(如0.20),导致几乎所有变量都"显著"
  • 样本量很大,大多数变量都具有统计显著性
  • 变量之间相关性较低
  • 使用了向后法,且Pout设置过小

建议:

  • 降低Pin值(如0.05或0.01)
  • 如果使用向后法,适当提高Pout值
  • 改用向前法或逐步法
  • 使用更严格的标准(如调整R²变化量)
  • 考虑使用正则化方法(如LASSO回归)

8.5 逐步回归与全模型差异很大?

正常情况:

  • 逐步回归剔除了不显著变量,保留的变量系数可能与全模型有所差异
  • 这是正常的,因为去除了共线性和不显著变量的干扰

需要关注的情况:

  • 如果系数符号改变(如从正变负),可能存在严重共线性
  • 如果R²下降很多(如从0.8降到0.4),需要检查是否剔除了重要变量
  • 可尝试不同的逐步方法进行对比验证