相关性分析计算说明

提示:本指南只针对相关性分析特有的内容进行描述,关于软件的通用操作流程(如文件上传、参数设置、结果下载等),请查看:通用计算说明

1. 方法概述

相关性分析是用于研究两个或多个变量之间关联程度的统计方法。本工具提供了三种常用的相关性分析方法:

  • Pearson相关性分析:用于度量两个连续变量之间的线性相关程度
  • Spearman相关性分析:基于秩次的非参数方法,用于评估单调关系强度
  • Kendall相关性分析:基于一致对和不一致对的非参数方法,对小样本更稳健

每种方法都会生成相关系数矩阵、P值矩阵、显著性标记以及可视化热力图。

2. 三种方法的适用场景

2.1 Pearson相关性分析

适用条件:

  • 变量为连续型数据(区间或比率尺度)
  • 数据服从双变量正态分布
  • 变量间存在线性关系
  • 数据中无明显异常值

典型应用场景:

  • 身高与体重的关系研究
  • 温度与销售额的关联分析
  • 学习时间与考试成绩的相关性
  • 经济指标间的线性关系分析

优势:

  • 计算简单,结果易于解释
  • 统计检验理论成熟
  • 广泛应用于各个领域

局限性:

  • 只能检测线性关系
  • 对异常值敏感
  • 要求数据服从正态分布

2.2 Spearman相关性分析

适用条件:

  • 至少一个变量为顺序(序数)数据
  • 数据不满足正态分布假设
  • 存在明显的异常值
  • 变量间存在非线性但单调的关系

典型应用场景:

  • 满意度等级与购买意愿的关系
  • 教育水平(小学/中学/大学)与收入的关联
  • 产品排名与销量排名的一致性
  • 包含异常值的数据相关性分析

优势:

  • 不要求数据服从正态分布
  • 对异常值不敏感
  • 可以度量非线性单调关系
  • 适用于等级数据

局限性:

  • 只能检测单调关系
  • 相同秩次(tied ranks)会影响结果
  • 信息损失(将原始数据转换为秩次)

2.3 Kendall相关性分析

适用条件:

  • 小样本数据(n < 30)
  • 序数(等级)数据
  • 需要稳健性检验
  • 列联表分析

典型应用场景:

  • 小样本的相关性研究
  • Meta分析中的相关性评估
  • 评委打分的一致性检验
  • 需要稳健统计推断的研究

优势:

  • 对小样本更加稳健
  • 解释更直观(基于一致对和不一致对)
  • 提供三种tau系数适应不同数据结构
  • 统计性质优良

局限性:

  • 计算复杂度较高(O(n²))
  • 系数绝对值通常小于Spearman系数
  • 大样本计算耗时较长

2.4 方法选择建议

数据特征 推荐方法 理由
连续数据 + 正态分布 + 线性关系 Pearson 最优选择,检验效能最高
连续数据 + 非正态分布 Spearman 稳健性好,不受分布影响
包含异常值 Spearman 对异常值不敏感
等级/序数数据 Spearman或Kendall 都适用,Kendall更稳健
小样本(n < 30) Kendall 小样本性质更优
大样本 + 非线性单调关系 Spearman 计算效率高
需要稳健性检验 Kendall 统计性质最稳健

3. 数据文件格式

3.1 文件结构要求

相关性分析需要上传包含两个Sheet的Excel文件:

  1. 原始矩阵:包含需要分析的变量数据
  2. 显著性配置:定义显著性水平和对应的星级标记

3.2 原始矩阵格式

格式要求:

  • 第一行为变量名称(如:变量1、变量2、变量3…)
  • 数据区域为各变量的观测值(数值型数据)
  • 不允许有缺失值

数据示例:

身高(cm) 体重(kg) 年龄 收入
170 65 25 5000
175 70 28 6000
165 60 24 4500
180 75 30 7000
168 63 26 5500

3.3 显著性配置格式

格式要求:

  • 必须包含两列:显著性水平星级
  • 显著性水平为数值(如0.01、0.05)
  • 星级为对应的标记符号(如**、*)

配置示例:

显著性水平 星级
0.01 **
0.05 *

说明:

  • 当P值 < 0.01时,相关系数后标记**
  • 当P值 < 0.05时,相关系数后标记*
  • 当P值 ≥ 0.05时,不标记(不显著)

如无特殊要求,默认使用示例文件里的显著性配置即可

4. 使用步骤

4.1 Pearson相关性分析

步骤1:上传数据文件

上传包含"原始矩阵"和"显著性配置"两个Sheet的Excel文件。

步骤2:参数设置

  • 显著性检验方式

    • 双尾检验(默认):检验相关系数是否显著不为0
    • 单尾检验:检验相关系数是否显著大于0
  • 结果保留小数位

    • 默认值:3
    • 取值范围:1-10
    • 控制相关系数和P值的小数精度

步骤3:绘图设置

<div style=“text-align: center;”> <img src=“/guide/figures/相关性分析/热力图.png” width=“1100” alt=“热力图”> </div>

可自定义热力图的样式:

  • 颜色方案:选择热力图配色(如RdBu_r、coolwarm等)
  • 显示数值:是否在热力图单元格中显示相关系数
  • 图像尺寸:设置图像宽度和高度
  • 字体设置
    • 坐标轴文字字体(中文标签)
    • 数值字体(相关系数)
    • X轴标签旋转角度
    • 字体大小设置

步骤4:查看结果

<div style=“text-align: center;”> <img src=“/guide/figures/相关性分析/结果文件.png” width=“700” alt=“结果文件”> </div>

结果Excel文件包含以下Sheet:

  1. 原始矩阵:上传的原始数据
  2. 相关系数矩阵(带显著性标记):相关系数 + 星号标记
  3. 相关系数矩阵(纯数值):仅相关系数数值
  4. P值矩阵:每对变量的显著性P值
  5. 显著性说明:星号标记的含义说明

4.2 Spearman相关性分析

使用步骤与Pearson相关性分析完全相同,参数设置和结果文件结构也一致。

主要区别:

  • 计算方法基于秩次而非原始数值
  • 适用于非正态分布数据
  • 可以检测非线性单调关系

4.3 Kendall相关性分析

步骤1:上传数据文件

与Pearson和Spearman相同。

步骤2:参数设置

除了Pearson和Spearman的参数外,Kendall还需要选择:

  • 计算方式

    • Kendall’s τ-a:不考虑并列等级,适用于无重复值数据
    • Kendall’s τ-b(推荐):考虑并列等级,最常用版本
    • Kendall’s τ-c:针对非方形表格调整,适用于列联表
  • 显著性检验方式:双尾检验或单尾检验

  • 结果保留小数位:1-10位小数

步骤3-4:绘图设置和查看结果

与Pearson和Spearman相同。

5. 结果解读

5.1 相关系数的含义

相关系数的取值范围为[-1, 1]:

相关系数绝对值 相关程度 说明
|r| = 1 完全相关 两变量完全线性相关(Pearson)或完全单调相关(Spearman/Kendall)
0.7 ≤ |r| < 1 强相关 两变量有很强的关联
0.4 ≤ |r| < 0.7 中等相关 两变量有一定程度的关联
0.2 ≤ |r| < 0.4 弱相关 两变量关联较弱
|r| < 0.2 极弱相关或不相关 两变量几乎没有关联

符号含义:

  • r > 0:正相关,一个变量增大时另一个也增大
  • r < 0:负相关,一个变量增大时另一个减小
  • r = 0:不相关,两变量之间没有线性/单调关系

5.2 显著性检验

P值的含义:

  • P < 0.01:非常显著,标记**
  • P < 0.05:显著,标记*
  • P ≥ 0.05:不显著,无标记

注意事项:

  • 相关系数大不代表一定显著(取决于样本量)
  • 小样本即使相关系数较大也可能不显著
  • 大样本即使相关系数很小也可能显著
  • 显著性只说明相关性存在,不说明相关性强弱

6. 常见问题

6.1 如何选择相关性分析方法?

:我的数据应该用哪种相关性分析方法?

  1. 首先检查数据类型

    • 连续数据 → 可以考虑Pearson
    • 等级/序数数据 → 使用Spearman或Kendall
  2. 检查数据分布

    • 正态分布 → Pearson最优
    • 非正态分布 → Spearman或Kendall
  3. 检查异常值

    • 有明显异常值 → Spearman或Kendall
    • 无异常值 → Pearson
  4. 考虑样本量

    • 小样本(n < 30) → Kendall更稳健
    • 大样本 → 三种方法都可以,Pearson和Spearman计算更快
  5. 关系类型

    • 线性关系 → Pearson
    • 非线性单调关系 → Spearman或Kendall

6.2 三种方法的结果为什么不同?

:对同一数据使用三种方法,为什么相关系数不一样?

:这是正常现象,因为:

  1. 计算原理不同

    • Pearson基于原始数值计算
    • Spearman基于秩次计算
    • Kendall基于一致对和不一致对计算
  2. 度量内容不同

    • Pearson度量线性关系
    • Spearman度量单调关系
    • Kendall也度量单调关系但方式不同
  3. 系数大小关系

    • 一般情况下:|τ| ≤ |ρs| ≤ |r|
    • Kendall系数通常最小,Pearson系数通常最大
  4. 选择建议

    • 如果三种方法结果一致(都显著或都不显著),说明关系稳健
    • 如果结果不一致,应根据数据特征选择最合适的方法

6.3 相关不等于因果

:两个变量高度相关,是否说明存在因果关系?

不一定。相关性分析只能说明两个变量之间存在关联,不能证明因果关系。

原因:

  1. 可能是巧合:两个变量恰好同时变化
  2. 可能有共同原因:第三个变量同时影响两个变量
  3. 可能是反向因果:实际因果方向与假设相反

例子:

  • 冰淇淋销量与溺水人数高度相关
  • 但不是冰淇淋导致溺水
  • 而是温度(第三变量)同时影响两者

建议:

  • 要证明因果关系需要实验设计或因果推断方法
  • 相关性分析只是探索性分析的第一步
  • 需要结合理论和其他证据

6.4 如何处理缺失值?

:我的数据有缺失值怎么办?

  1. 本工具要求:上传的数据不能有缺失值

  2. 处理方法

    • 删除法:删除包含缺失值的样本(样本量充足时)
    • 均值填充:用变量均值填充缺失值(简单但可能引入偏差)
    • 中位数填充:用中位数填充(对异常值更稳健)
    • 插值法:根据相邻数据插值
    • 多重插补:更复杂但更准确的方法
  3. 注意事项

    • 缺失值处理会影响结果
    • 应在文章中说明处理方法
    • 如果缺失比例过高(>20%),需谨慎解释结果

6.5 Kendall的三种tau如何选择?

:Kendall相关性分析有三种tau,应该选哪个?

  1. τ-a(tau-a)

    • 适用场景:理论上适用于完全没有同分对(Ties)​ 的数据集。
    • 特点:计算简单,但只要存在同分对,其值就会被低估,无法达到±1。现实数据很少满足此条件,故极少使用。
  2. τ-b(tau-b)【推荐】

    • 适用场景:这是最通用、最常推荐的版本,适用于任何存在同分对的情况,无论是连续数据、等级数据,还是列联表数据。
    • 特点:对同分进行了修正,是实际研究中的标准选择。大多数统计软件默认或最常用的就是τ-b。
    • 建议:作为默认选择,当你不确定时,就选τ-b。
  3. τ-c(tau-c)

    • 适用场景:主要用于行列数不等的分类列联表,且你特别关注这种表格结构本身时。
    • 特点:在社会科学处理特定分类变量时可能用到,但日常使用频率很低。

选择建议:

  • 默认和万能选择:选择τ-b
  • 特殊情况:明确分析行列不等的列联表时,可考虑τ-c
  • 理论情况:基本可忽略τ-a

6.6 双尾检验和单尾检验的区别?

:显著性检验应该选双尾还是单尾?

  1. 双尾检验(默认推荐)

    • 原假设:ρ = 0
    • 备择假设:ρ ≠ 0
    • 适用:不确定相关方向,只想知道是否相关
  2. 单尾检验

    • 原假设:ρ ≤ 0
    • 备择假设:ρ > 0
    • 适用:有明确理论预期,只关心正相关
  3. 选择建议

    • 探索性研究:使用双尾检验
    • 有明确方向预期:可使用单尾检验
    • 学术规范:双尾检验更保守,更被认可

7. 应用示例

7.1 教育研究示例

研究问题:学习时间、睡眠时间、运动时间与考试成绩的关系

数据收集:收集100名学生的数据

方法选择

  • 数据为连续型,基本符合正态分布
  • 选择Pearson相关性分析

预期结果

  • 学习时间与成绩:正相关
  • 睡眠时间与成绩:可能正相关
  • 运动时间与成绩:可能弱正相关或不相关

7.2 市场研究示例

研究问题:产品满意度等级与复购意愿等级的关系

数据收集:500名客户的满意度评分(1-5分)和复购意愿(1-5分)

方法选择

  • 数据为等级数据
  • 选择Spearman相关性分析

预期结果

  • 满意度与复购意愿应呈现强正相关
  • 如果相关性弱,说明满意度不是复购的主要因素

7.3 小样本研究示例

研究问题:20个城市的环保投入排名与空气质量排名的关系

数据收集:20个城市的数据(小样本)

方法选择

  • 样本量小(n=20)
  • 数据为排名(等级数据)
  • 选择Kendall相关性分析(τ-b)

预期结果

  • 环保投入与空气质量应呈现负相关(投入越多,空气质量排名越好,数值越小)