多元线性回归计算说明

提示:本指南只针对多元线性回归特有的内容进行描述,关于软件的通用操作流程(如文件上传、参数设置、结果下载等),请查看:通用计算说明

1. 方法概述

多元线性回归(Multiple Linear Regression)是一种统计分析方法,用于研究多个自变量(解释变量)与一个因变量(响应变量)之间的线性关系。

1.1 基本原理

多元线性回归模型的一般形式为: $$ Y = \beta_0 + \beta_1X_1 + \beta_2X_2 + … + \beta_nX_n + \varepsilon $$

其中:

  • $Y$:因变量

  • $X_1, X_2, …, X_n$:自变量

  • $\beta_0$:常数项(截距)

  • $\beta_1, \beta_2, …, \beta_n$:回归系数

  • $\varepsilon$:随机误差项

1.2 主要应用场景

  • 预测分析:根据自变量的值预测因变量的值
  • 影响因素分析:识别哪些因素对因变量有显著影响
  • 关系强度评估:量化各自变量对因变量的影响程度
  • 模型拟合:构建数学模型描述变量间的关系

2. 数据准备

2.1 数据文件格式

多元线性回归需要上传包含因变量和自变量的Excel文件。

数据格式要求:

<div style=“text-align: center;”> <!-- <img src=“/guide/figures/multiple_linear_regression/数据格式.png” width=“800” alt=“数据格式”> --> </div>

  • 第一行:列名(变量名称)
  • 后续行:数据值
  • 所有数据必须为数值类型(不能包含文字、符号等非数值内容)
  • 至少包含2列数据(1个因变量 + 至少1个自变量)

示例数据结构:

GDP 人口 投资 消费
100.5 50.2 30.1 45.3
105.3 51.0 32.5 47.8
110.8 51.8 35.2 50.1

2.2 数据质量要求

基本要求:

  • 数据完整,无缺失值或空白单元格
  • 所有变量为数值型数据
  • 样本量充足(一般要求样本数 > 自变量数 × 5)
  • 数据真实可靠,来源明确

注意事项:

  • 检查是否存在异常值或极端值
  • 确保自变量之间不存在严重的多重共线性
  • 因变量与自变量之间应存在线性关系

3. 参数设置

3.1 因变量选择

从数据中选择一列作为因变量(Y),其余列将自动作为自变量(X)。

选择原则:

  • 选择研究中需要预测或解释的变量
  • 确保该变量具有实际意义
  • 通常选择连续型变量

3.2 结果保留小数位

设置计算结果的小数位数,默认为3位。

可选范围: 1-10位

4. 绘图设置

多元线性回归提供实际值与预测值的对比图,帮助直观评估模型效果。

<div style=“text-align: center;”> <img src=“/guide/figures/多元线性回归/图表预览.png” width=“1100” alt=“图表预览”> </div>

4.1 图形尺寸设置

图形宽度: 设置图表宽度(默认10)
图形高度: 设置图表高度(默认6)
图像DPI: 设置图像分辨率(默认300,范围100-300)

4.2 字体设置

标签字体: 选择坐标轴标签的字体

  • 宋体(默认)
  • 黑体
  • 微软雅黑
  • 楷体
  • 仿宋
  • Times New Roman
  • Arial

标签字体大小: 设置坐标轴标签的字号(默认15)
刻度字体大小: 设置坐标轴刻度的字号(默认12)

4.3 线型和颜色设置

实际值颜色: 设置实际值曲线的颜色(默认蓝色)
预测值颜色: 设置预测值曲线的颜色(默认红色)

实际值标记: 选择实际值的标记样式

  • 圆形 (o) - 默认
  • 方形 (s)
  • 三角形 (^)
  • 菱形 (D)
  • 星形 (*)

预测值标记: 选择预测值的标记样式(默认方形)

显示网格: 是否在图表中显示网格线(默认开启)

4.4 坐标轴标签

X轴标签: 设置X轴的标签文字(默认"样本")
Y轴标签: 设置Y轴的标签文字(默认"值")

4.5 图表预览与更新

设置完绘图参数后,点击应用并更新图表按钮即可实时预览图表效果,可以多次调整参数直到满意为止。

5. 计算结果

计算完成后,系统将生成包含以下内容的Excel结果文件:

5.1 回归分析结果表

<div style=“text-align: center;”> <img src=“/guide/figures/多元线性回归/回归分析结果.png” width=“1200” alt=“回归分析结果”> </div>

结果表包含以下列:

变量列:

  • 列出所有自变量和常数项

非标准化系数:

  • B:回归系数,表示自变量每变化一个单位,因变量的平均变化量
  • 标准误:系数的标准误差,用于计算t值

标准化系数:

  • Beta:标准化回归系数,用于比较不同自变量的相对重要性(消除了量纲影响)

检验统计量:

  • t:t统计量,用于检验回归系数是否显著
  • P:显著性水平,带星号标记
    • ***:p < 0.01(1%显著性水平)
    • **:p < 0.05(5%显著性水平)
    • *:p < 0.1(10%显著性水平)

共线性诊断:

  • VIF:方差膨胀因子,用于检测多重共线性
    • VIF < 5:无共线性问题(严格标准)
    • VIF < 10:可接受(宽松标准)
    • VIF > 10:存在严重共线性
    • VIF = ∞:存在完全共线性

模型拟合度:

  • :决定系数,表示模型的拟合优度(0-1之间,越接近1越好)
  • 调整R²:考虑自变量个数的调整后决定系数
  • RMSE:均方根误差,表示预测值与实际值的平均偏差(越小越好)

F检验:

  • F:F统计量及其显著性,用于检验整体回归模型是否显著

5.2 实际值与预测值对比表

<div style=“text-align: center;”> <img src=“/guide/figures/多元线性回归/对比.png” width=“500” alt=“对比”> </div>

包含每个样本的:

  • 样本编号
  • 实际值:原始数据中的因变量值
  • 预测值:模型预测的因变量值
  • 残差:实际值与预测值的差(实际值 - 预测值)

5.3 实际值与预测值对比图

<div style=“text-align: center;”> <img src=“/guide/figures/多元线性回归/对比图.png” width=“800” alt=“实际值与预测值对比图”> </div>

对比图展示:

  • 蓝色圆圈线:实际值曲线
  • 红色方块虚线:预测值曲线
  • 两条曲线越接近,说明模型拟合效果越好

6. 结果解读

6.1 F检验解读

F检验的作用: 检验模型整体是否存在显著的线性关系

判断标准:

  • P < 0.01:在1%水平上显著,模型非常显著,拒绝"回归系数全为0"的原假设
  • P < 0.05:在5%水平上显著,模型显著
  • P < 0.1:在10%水平上显著,模型基本显著
  • P ≥ 0.1:模型不显著,可能不适合使用

示例解读:

F检验的结果分析可以得到,显著性P值为0.000***,在1%水平上呈现显著性,拒绝回归系数为0的原假设,因此模型基本满足要求。

6.2 R²和调整R²解读

R²(决定系数):

  • 表示自变量能够解释因变量变异的比例
  • R² = 0.8 表示模型可以解释80%的因变量变异
  • 一般标准:
    • R² > 0.8:拟合效果很好
    • 0.5 < R² < 0.8:拟合效果较好
    • R² < 0.5:拟合效果一般

调整R²:

  • 考虑了自变量个数的影响,更适合比较不同模型
  • 调整R²通常小于R²
  • 可以避免因增加自变量而虚高的R²

注意: 在某些研究领域(如社会科学),R²可能较低但模型仍然有意义,关键是F检验是否通过。

6.3 回归系数解读

非标准化系数B:

  • 表示在其他变量不变的情况下,该自变量每增加1个单位,因变量的平均变化量
  • 保留了原始变量的量纲和单位

标准化系数Beta:

  • 消除了量纲影响,可用于比较不同自变量的相对重要性
  • |Beta|越大,说明该变量对因变量的影响越大

显著性检验:

  • 看P值和星号标记
  • P < 0.05的变量通常认为是显著影响因素

6.4 VIF共线性诊断

多重共线性: 指自变量之间存在高度相关关系,会导致:

  • 回归系数估计不稳定
  • 标准误增大
  • t检验失效
  • VIF值异常

处理建议:

  • VIF > 10:存在严重共线性,建议:

    1. 删除共线性变量(保留理论上更重要的)
    2. 使用岭回归(Ridge Regression)
    3. 使用逐步回归筛选变量
  • VIF = ∞:存在完全共线性,必须处理

示例警告:

对于变量共线性表现,变量 投资、消费 VIF值大于10,存在共线关系,建议移除共线性的自变量或者进行岭回归或逐步回归。

6.5 RMSE解读

RMSE(均方根误差):

  • 表示预测值与实际值之间的平均偏差
  • RMSE越小,说明模型预测精度越高
  • 单位与因变量相同,便于理解

使用场景:

  • 评估模型预测能力
  • 比较不同模型的预测效果
  • 设定预测精度的可接受范围

6.6 回归方程

系统会自动生成回归方程,例如:

$$ GDP = 10.523 + 2.345 \times 人口 + 1.234 \times 投资 - 0.567 \times 消费 $$

使用方法:

  • 将新的自变量值代入方程,即可预测因变量值
  • 系数的正负号表示该变量对因变量的影响方向