KMeans聚类分析计算说明

提示:本指南只针对KMeans聚类方法特有的内容进行描述,关于软件的通用操作流程(如文件上传、参数设置、结果下载等),请查看:通用计算说明

1. 方法概述

KMeans聚类是一种无监督机器学习算法,用于将数据点分组到k个聚类中,使得同一聚类内的数据点相似度高,不同聚类间的数据点相似度低。该算法通过迭代优化聚类中心,最小化聚类内误差平方和。

主要特点:

  • 无监督学习:不需要预先标记的训练数据
  • 距离驱动:基于欧几里得距离进行聚类
  • 迭代优化:通过反复更新聚类中心达到最优解

2. 数据准备

2.1 数据格式要求

KMeans聚类需要上传包含数值特征的Excel文件:

<div style=“text-align: center;”> <img src=“/guide/figures/kmeans/kmeans数据格式.png” width=“600” alt=“KMeans数据格式”> </div>

数据组织要求:

  • 第一列为对象列,后续列为特征列
  • 所有数据必须为数值型,不能出现空值、文本、日期等非数值型数据

3. 参数设置

3.1 基本计算参数

3.1.1 自动计算聚类数

  • 功能:系统自动确定最优聚类数量
  • 默认值:开启
  • 说明:开启后无需手动指定聚类数,系统会通过算法自动寻找最优k值

<div style=“text-align: center;”> <img src=“/guide/figures/kmeans/参数设置.png” width=“400” alt=“参数设置”> </div>

3.1.2 自动计算方法

当开启自动计算聚类数时,可选择以下方法:

手肘法(Elbow Method)

  • 原理:寻找误差平方和(SSE)下降速率显著变缓的拐点
  • 适用场景:数据聚类结构较为明显的情况
  • 评价指标:SSE(Sum of Squared Errors)

轮廓系数法(Silhouette Method)

  • 原理:评估样本与其所在聚类的相似度和与其他聚类的差异度
  • 适用场景:需要综合考虑聚类内聚度和分离度的情况
  • 评价指标:轮廓系数(取值范围:-1到1,越接近1越好)

3.1.3 手动设置聚类数

  • 取值范围:2-20
  • 默认值:2
  • 选择建议
    • 根据业务需求确定
    • 参考自动计算结果

<div style=“text-align: center;”> <img src=“/guide/figures/kmeans/手动聚类.png” width=“400” alt=“手动聚类”> </div>

3.1.4 结果保留小数位

计算结果的保留小数位数,默认为5位,可设置1-10位。

3.2 绘图参数设置

3.2.1 自动计算方法图表设置

<div style=“text-align: center;”> <img src=“/guide/figures/kmeans/手肘法图表.png” width=“1200” alt=“手肘法图表”> </div>

当开启自动计算聚类数时,可设置对应方法的图表参数:

线条设置: 线条宽度、颜色、散点大小、散点形状

图形尺寸: 图像的宽高设置

字体设置: 字体类型、字体大小

坐标轴标签:

  • X轴标签:默认"聚类数 (K)"
  • Y轴标签:手肘法默认"误差平方和 (SSE)“,轮廓系数法默认"轮廓系数”

辅助显示:

  • 显示图例和最优K虚线:开启/关闭(默认开启)
  • 虚线颜色:标记最优聚类数的虚线颜色(默认红色)

修改绘图参数后,点击下方的应用并更新图表按钮,即可更新右侧的图表,满意后可在图片上右键另存为。

3.2.2 聚类散点图设置

<div style=“text-align: center;”> <img src=“/guide/figures/kmeans/聚类散点图.png” width=“1200” alt=“聚类散点图”> </div>

散点设置: 散点大小、颜色映射

图形设置: 图像的宽高设置、图例位置

字体设置: 字体类型、字体大小

坐标轴设置: X轴标签、Y轴标签

4. 计算结果

4.1 聚类结果

<div style=“text-align: center;”> <img src=“/guide/figures/kmeans/聚类结果.png” width=“500” alt=“聚类结果”> </div>

聚类结果表里包含原始矩阵的所有样本,并在最后一列加上了该样本的聚类标签。

4.2 聚类中心

<div style=“text-align: center;”> <img src=“/guide/figures/kmeans/聚类中心.png” width=“500” alt=“聚类中心”> </div>

聚类中心表里包含每个聚类标签对应的中心坐标。

4.3 统计信息

<div style=“text-align: center;”> <img src=“/guide/figures/kmeans/统计信息.png” width=“400” alt=“统计信息”> </div>

  • 聚类数量:最终确定的聚类数
  • 聚类质量指标:轮廓系数

5. 可视化图表解读

5.1 聚类散点图

  • 颜色区分:不同颜色代表不同聚类
  • 空间分布:点的分布反映聚类的紧密度和分离度
  • 边界清晰度:聚类边界是否清晰

5.2 手肘法图表

  • 趋势观察:SSE 随 K 值增加的下降趋势
  • 拐点识别:下降速率明显变缓的点为最优 K 值
  • 平滑度:曲线越平滑,拐点越明显

5.3 轮廓系数图表

  • 峰值寻找:轮廓系数最大值对应的 K 值为最优选择

6. 常见问题

6.1 数据相关问题

:数据包含文本或分类变量怎么办?

:KMeans只能处理数值型数据,需要预处理:

  • 文本数据:使用词向量或TF-IDF转换
  • 分类变量:使用独热编码(One-hot Encoding)
  • 有序分类:使用标签编码(Label Encoding)

:数据量纲差异很大如何处理?

:建议进行数据标准化:

  • Z-score标准化:(x - μ) / σ
  • 最小-最大标准化:(x - min) / (max - min)
  • 在Excel中预处理或使用专业数据处理工具

6.2 聚类数选择问题

:手肘法没有明显拐点怎么办?

:可以尝试以下方法:

  • 使用轮廓系数法
  • 结合业务知识判断
  • 尝试不同的 K 值看聚类效果
  • 考虑数据是否适合聚类分析

:两种自动方法给出不同结果怎么选择?

:综合考虑多个因素:

  • 业务需求和可解释性
  • 聚类结果的稳定性
  • 后续应用的要求
  • 可以都尝试并比较效果

6.3 结果解读问题

:轮廓系数很低说明什么?

:可能的原因和解决方案:

  • 数据本身没有明显聚类结构:考虑其他分析方法
  • 特征选择不当:重新选择或构造特征
  • 聚类数不合适:尝试其他 K 值
  • 数据需要预处理:标准化、降噪等