文本分词使用说明
1. 方法概述
文本分词用于把原始文本拆分为一个个词语,是文本分析工具的基础步骤。分词完成后,系统会生成分词文件、词频 Excel 和高频词预览,后续词云、情感、聚类、主题、社会网络分析会自动使用该分词结果。
2. 参数说明
<div style=“text-align: center;”> <img src=“/guide/figures/文本分析/分词配置.png” width=“1200” alt=“分词配置”> </div>
2.1 过滤选项
可选择过滤以下内容:
- 英文:过滤英文字符和英文单词。
- 数字:过滤数字内容。
- 网址:过滤 URL 链接。
- 空格:过滤多余空白。
- 标点:过滤标点符号。
如果研究对象包含英文品牌名、型号或代码,不建议过滤英文;如果数字本身有研究意义,也不建议过滤数字。
2.2 最小词长度
用于过滤长度小于指定值的词语。常见设置:
- 设置为 1:尽量保留所有词。
- 设置为 2:过滤大量单字词,适合多数中文文本。
- 设置为 3 及以上:适合只关注较长术语的场景,但可能丢失有效短词。
2.3 停用词配置
点击【查看停用词表】可以管理停用词。停用词是分析中不希望保留的常见词,例如“的”“了”“是”等。
<div style=“text-align: center;”> <img src=“/guide/figures/文本分析/停用词.png” width=“700” alt=“停用词”> </div>
建议根据数据类型补充停用词:
- 问卷开放题:可加入“没有”“一般”“还行”等低信息词,具体需结合研究目的判断。
- 评论文本:可加入平台名称、店铺名称、重复模板词。
- 政策文本:可加入“加强”“推进”等高频但区分度较低的行政表达,谨慎处理。
3. 操作步骤
- 进入文本分析项目详情页。
- 打开【文本分词】标签页。
- 设置过滤选项、最小词长度和停用词。
- 点击【开始分词】。
- 查看统计卡片和高频词预览。
- 如结果不理想,调整参数后点击【重新分词】。
4. 结果说明
<div style=“text-align: center;”> <img src=“/guide/figures/文本分析/分词结果.png” width=“1200” alt=“分词结果”> </div>
分词结果页面包含:
- 文本总数:项目中原始文本记录数量。
- 有效文本数:成功分词并参与分析的文本数量。
- 总词数:全部有效文本分词后的词语总数。
- 唯一词数:去重后的词语数量。
- 平均词数/文本:每条文本平均包含的词语数量。
- 分词文件:可下载的分词结果文件。
- 高频词预览:展示排名、词语、出现次数和频率。
5. 分析建议
- 分词后先看高频词,不要直接进入后续分析。
- 高频词中如果出现大量“这个”“那个”“我们”等无意义词,应先补充停用词。
- 高频词中如果核心研究词被误删,应检查过滤选项和停用词。
- 后续分析结果异常时,优先回到分词步骤检查基础结果。