文本聚类使用说明

1. 方法概述

文本聚类用于根据文本内容相似度,把文本自动划分为若干类别。系统当前使用 K-Means 聚类,并基于 TF-IDF 特征表示文本内容。

该功能适合发现评论类型、问卷回答类型、访谈材料类别和文本样本中的潜在分组。

2. 参数说明

<div style=“text-align: center;”> <img src=“/guide/figures/文本分析/聚类配置.png” width=“1000” alt=“聚类配置”> </div>

2.1 聚类算法

当前支持 K-Means 聚类。K-Means 会把文本划分为指定数量的类别,使同一类别内文本更相似,不同类别之间差异更明显。

2.2 类别数量

控制文本将被分为多少个类别,支持 2 到 20。

设置建议:

  • 初次探索可从 3 到 5 类开始。
  • 样本量较小不宜设置过多类别。
  • 如果类别解释困难,可以减少类别数量。
  • 如果每类内部差异仍然很大,可以增加类别数量。

2.3 最大特征数

控制 TF-IDF 向量化时保留的最大特征维度,支持 100 到 1000。

设置建议:

  • 文本较短或样本较少:可设置 100 到 300。
  • 文本较长或语义更复杂:可设置 500 到 1000。
  • 特征数越大,保留信息越多,但也可能引入噪声。

3. 操作步骤

  1. 完成文本分词。
  2. 打开【文本聚类】标签页。
  3. 设置类别数量和最大特征数。
  4. 点击【开始分析】。
  5. 查看聚类可视化图、各类别统计信息和典型文本。
  6. 点击【下载聚类结果Excel】保存每条文本所属类别。

4. 结果说明

<div style=“text-align: center;”> <img src=“/guide/figures/文本分析/聚类结果-1.png” width=“1200” alt=“聚类结果”> </div>

<div style=“text-align: center;”> <img src=“/guide/figures/文本分析/聚类结果-2.png” width=“1200” alt=“聚类结果”> </div>

文本聚类结果包含:

  • 类别数量:实际生成的聚类类别数。
  • 轮廓系数:衡量聚类效果,越接近 1 通常表示聚类效果越好。
  • 有效文本数:参与聚类的文本数量。
  • 聚类可视化(PCA降维):把高维文本特征降维后展示不同类别分布。
  • 各类别统计信息:展示每个类别的文本数量、关键词或代表性内容。
  • 聚类结果 Excel:包含每条文本的聚类类别。

5. 解读建议

  • 聚类类别需要结合关键词和典型文本进行命名,系统类别编号本身没有语义。
  • 轮廓系数较低不一定代表结果完全不可用,但说明类别边界可能不明显。
  • 如果某个类别样本极少,可能是异常文本,也可能是类别数量设置过多。
  • 聚类适合发现结构,不适合直接替代人工编码和理论解释。