KMeans聚类分析计算说明
提示:本指南只针对KMeans聚类方法特有的内容进行描述,关于软件的通用操作流程(如文件上传、参数设置、结果下载等),请查看:通用计算说明
1. 方法概述
KMeans聚类是一种无监督机器学习算法,用于将数据点分组到k个聚类中,使得同一聚类内的数据点相似度高,不同聚类间的数据点相似度低。该算法通过迭代优化聚类中心,最小化聚类内误差平方和。
主要特点:
- 无监督学习:不需要预先标记的训练数据
- 距离驱动:基于欧几里得距离进行聚类
- 迭代优化:通过反复更新聚类中心达到最优解
2. 数据准备
2.1 数据格式要求
KMeans聚类需要上传包含数值特征的Excel文件:
<div style=“text-align: center;”> <img src=“/guide/figures/kmeans/kmeans数据格式.png” width=“600” alt=“KMeans数据格式”> </div>
数据组织要求:
- 第一列为对象列,后续列为特征列
- 所有数据必须为数值型,不能出现空值、文本、日期等非数值型数据
3. 参数设置
3.1 基本计算参数
3.1.1 自动计算聚类数
- 功能:系统自动确定最优聚类数量
- 默认值:开启
- 说明:开启后无需手动指定聚类数,系统会通过算法自动寻找最优k值
<div style=“text-align: center;”> <img src=“/guide/figures/kmeans/参数设置.png” width=“400” alt=“参数设置”> </div>
3.1.2 自动计算方法
当开启自动计算聚类数时,可选择以下方法:
手肘法(Elbow Method)
- 原理:寻找误差平方和(SSE)下降速率显著变缓的拐点
- 适用场景:数据聚类结构较为明显的情况
- 评价指标:SSE(Sum of Squared Errors)
轮廓系数法(Silhouette Method)
- 原理:评估样本与其所在聚类的相似度和与其他聚类的差异度
- 适用场景:需要综合考虑聚类内聚度和分离度的情况
- 评价指标:轮廓系数(取值范围:-1到1,越接近1越好)
3.1.3 手动设置聚类数
- 取值范围:2-20
- 默认值:2
- 选择建议:
- 根据业务需求确定
- 参考自动计算结果
<div style=“text-align: center;”> <img src=“/guide/figures/kmeans/手动聚类.png” width=“400” alt=“手动聚类”> </div>
3.1.4 结果保留小数位
计算结果的保留小数位数,默认为5位,可设置1-10位。
3.2 绘图参数设置
3.2.1 自动计算方法图表设置
<div style=“text-align: center;”> <img src=“/guide/figures/kmeans/手肘法图表.png” width=“1200” alt=“手肘法图表”> </div>
当开启自动计算聚类数时,可设置对应方法的图表参数:
线条设置: 线条宽度、颜色、散点大小、散点形状
图形尺寸: 图像的宽高设置
字体设置: 字体类型、字体大小
坐标轴标签:
- X轴标签:默认"聚类数 (K)"
- Y轴标签:手肘法默认"误差平方和 (SSE)“,轮廓系数法默认"轮廓系数”
辅助显示:
- 显示图例和最优K虚线:开启/关闭(默认开启)
- 虚线颜色:标记最优聚类数的虚线颜色(默认红色)
修改绘图参数后,点击下方的应用并更新图表按钮,即可更新右侧的图表,满意后可在图片上右键另存为。
3.2.2 聚类散点图设置
<div style=“text-align: center;”> <img src=“/guide/figures/kmeans/聚类散点图.png” width=“1200” alt=“聚类散点图”> </div>
散点设置: 散点大小、颜色映射
图形设置: 图像的宽高设置、图例位置
字体设置: 字体类型、字体大小
坐标轴设置: X轴标签、Y轴标签
4. 计算结果
4.1 聚类结果
<div style=“text-align: center;”> <img src=“/guide/figures/kmeans/聚类结果.png” width=“500” alt=“聚类结果”> </div>
聚类结果表里包含原始矩阵的所有样本,并在最后一列加上了该样本的聚类标签。
4.2 聚类中心
<div style=“text-align: center;”> <img src=“/guide/figures/kmeans/聚类中心.png” width=“500” alt=“聚类中心”> </div>
聚类中心表里包含每个聚类标签对应的中心坐标。
4.3 统计信息
<div style=“text-align: center;”> <img src=“/guide/figures/kmeans/统计信息.png” width=“400” alt=“统计信息”> </div>
- 聚类数量:最终确定的聚类数
- 聚类质量指标:轮廓系数
5. 可视化图表解读
5.1 聚类散点图
- 颜色区分:不同颜色代表不同聚类
- 空间分布:点的分布反映聚类的紧密度和分离度
- 边界清晰度:聚类边界是否清晰
5.2 手肘法图表
- 趋势观察:SSE 随 K 值增加的下降趋势
- 拐点识别:下降速率明显变缓的点为最优 K 值
- 平滑度:曲线越平滑,拐点越明显
5.3 轮廓系数图表
- 峰值寻找:轮廓系数最大值对应的 K 值为最优选择
6. 常见问题
6.1 数据相关问题
问:数据包含文本或分类变量怎么办?
答:KMeans只能处理数值型数据,需要预处理:
- 文本数据:使用词向量或TF-IDF转换
- 分类变量:使用独热编码(One-hot Encoding)
- 有序分类:使用标签编码(Label Encoding)
问:数据量纲差异很大如何处理?
答:建议进行数据标准化:
- Z-score标准化:(x - μ) / σ
- 最小-最大标准化:(x - min) / (max - min)
- 在Excel中预处理或使用专业数据处理工具
6.2 聚类数选择问题
问:手肘法没有明显拐点怎么办?
答:可以尝试以下方法:
- 使用轮廓系数法
- 结合业务知识判断
- 尝试不同的 K 值看聚类效果
- 考虑数据是否适合聚类分析
问:两种自动方法给出不同结果怎么选择?
答:综合考虑多个因素:
- 业务需求和可解释性
- 聚类结果的稳定性
- 后续应用的要求
- 可以都尝试并比较效果
6.3 结果解读问题
问:轮廓系数很低说明什么?
答:可能的原因和解决方案:
- 数据本身没有明显聚类结构:考虑其他分析方法
- 特征选择不当:重新选择或构造特征
- 聚类数不合适:尝试其他 K 值
- 数据需要预处理:标准化、降噪等