文本聚类使用说明
1. 方法概述
文本聚类用于根据文本内容相似度,把文本自动划分为若干类别。系统当前使用 K-Means 聚类,并基于 TF-IDF 特征表示文本内容。
该功能适合发现评论类型、问卷回答类型、访谈材料类别和文本样本中的潜在分组。
2. 参数说明
<div style=“text-align: center;”> <img src=“/guide/figures/文本分析/聚类配置.png” width=“1000” alt=“聚类配置”> </div>
2.1 聚类算法
当前支持 K-Means 聚类。K-Means 会把文本划分为指定数量的类别,使同一类别内文本更相似,不同类别之间差异更明显。
2.2 类别数量
控制文本将被分为多少个类别,支持 2 到 20。
设置建议:
- 初次探索可从 3 到 5 类开始。
- 样本量较小不宜设置过多类别。
- 如果类别解释困难,可以减少类别数量。
- 如果每类内部差异仍然很大,可以增加类别数量。
2.3 最大特征数
控制 TF-IDF 向量化时保留的最大特征维度,支持 100 到 1000。
设置建议:
- 文本较短或样本较少:可设置 100 到 300。
- 文本较长或语义更复杂:可设置 500 到 1000。
- 特征数越大,保留信息越多,但也可能引入噪声。
3. 操作步骤
- 完成文本分词。
- 打开【文本聚类】标签页。
- 设置类别数量和最大特征数。
- 点击【开始分析】。
- 查看聚类可视化图、各类别统计信息和典型文本。
- 点击【下载聚类结果Excel】保存每条文本所属类别。
4. 结果说明
<div style=“text-align: center;”> <img src=“/guide/figures/文本分析/聚类结果-1.png” width=“1200” alt=“聚类结果”> </div>
<div style=“text-align: center;”> <img src=“/guide/figures/文本分析/聚类结果-2.png” width=“1200” alt=“聚类结果”> </div>
文本聚类结果包含:
- 类别数量:实际生成的聚类类别数。
- 轮廓系数:衡量聚类效果,越接近 1 通常表示聚类效果越好。
- 有效文本数:参与聚类的文本数量。
- 聚类可视化(PCA降维):把高维文本特征降维后展示不同类别分布。
- 各类别统计信息:展示每个类别的文本数量、关键词或代表性内容。
- 聚类结果 Excel:包含每条文本的聚类类别。
5. 解读建议
- 聚类类别需要结合关键词和典型文本进行命名,系统类别编号本身没有语义。
- 轮廓系数较低不一定代表结果完全不可用,但说明类别边界可能不明显。
- 如果某个类别样本极少,可能是异常文本,也可能是类别数量设置过多。
- 聚类适合发现结构,不适合直接替代人工编码和理论解释。