文本分词使用说明

1. 方法概述

文本分词用于把原始文本拆分为一个个词语,是文本分析工具的基础步骤。分词完成后,系统会生成分词文件、词频 Excel 和高频词预览,后续词云、情感、聚类、主题、社会网络分析会自动使用该分词结果。

2. 参数说明

<div style=“text-align: center;”> <img src=“/guide/figures/文本分析/分词配置.png” width=“1200” alt=“分词配置”> </div>

2.1 过滤选项

可选择过滤以下内容:

  • 英文:过滤英文字符和英文单词。
  • 数字:过滤数字内容。
  • 网址:过滤 URL 链接。
  • 空格:过滤多余空白。
  • 标点:过滤标点符号。

如果研究对象包含英文品牌名、型号或代码,不建议过滤英文;如果数字本身有研究意义,也不建议过滤数字。

2.2 最小词长度

用于过滤长度小于指定值的词语。常见设置:

  • 设置为 1:尽量保留所有词。
  • 设置为 2:过滤大量单字词,适合多数中文文本。
  • 设置为 3 及以上:适合只关注较长术语的场景,但可能丢失有效短词。

2.3 停用词配置

点击【查看停用词表】可以管理停用词。停用词是分析中不希望保留的常见词,例如“的”“了”“是”等。

<div style=“text-align: center;”> <img src=“/guide/figures/文本分析/停用词.png” width=“700” alt=“停用词”> </div>

建议根据数据类型补充停用词:

  • 问卷开放题:可加入“没有”“一般”“还行”等低信息词,具体需结合研究目的判断。
  • 评论文本:可加入平台名称、店铺名称、重复模板词。
  • 政策文本:可加入“加强”“推进”等高频但区分度较低的行政表达,谨慎处理。

3. 操作步骤

  1. 进入文本分析项目详情页。
  2. 打开【文本分词】标签页。
  3. 设置过滤选项、最小词长度和停用词。
  4. 点击【开始分词】。
  5. 查看统计卡片和高频词预览。
  6. 如结果不理想,调整参数后点击【重新分词】。

4. 结果说明

<div style=“text-align: center;”> <img src=“/guide/figures/文本分析/分词结果.png” width=“1200” alt=“分词结果”> </div>

分词结果页面包含:

  • 文本总数:项目中原始文本记录数量。
  • 有效文本数:成功分词并参与分析的文本数量。
  • 总词数:全部有效文本分词后的词语总数。
  • 唯一词数:去重后的词语数量。
  • 平均词数/文本:每条文本平均包含的词语数量。
  • 分词文件:可下载的分词结果文件。
  • 高频词预览:展示排名、词语、出现次数和频率。

5. 分析建议

  • 分词后先看高频词,不要直接进入后续分析。
  • 高频词中如果出现大量“这个”“那个”“我们”等无意义词,应先补充停用词。
  • 高频词中如果核心研究词被误删,应检查过滤选项和停用词。
  • 后续分析结果异常时,优先回到分词步骤检查基础结果。