词频统计
把一篇文章、一批评论或一份日志丢进来,看看反复出现的是哪些词。中文这边没有用词库,而是统计所有二到四字的连续片段,再把「总是作为更长词一部分出现」的碎片剔掉——对新词和专有名词反而比固定词库更友好。文本只在你的浏览器里处理。
说明
- 中文是怎么切的
- 先按标点、空白、数字和英文把文本切成纯汉字的片段,然后在每个片段里枚举所有长度 2–4 的连续子串并计数。这一步会产出大量垃圾,比如「人工智」「工智能」都会跟着「人工智能」一起被数到。接着做一次剪枝:如果一个短片段的出现次数,和某个包含它的更长片段完全相同,说明它从来没有独立出现过,直接剔掉。剩下的基本就是真正独立成词的部分。
- 这种做法的长处和短处
- 长处是不依赖词库,新词、人名、产品名、网络用语都能切出来,改版也不用维护词典。短处是对短文本不准——一个词只出现一次时无法判断边界,所以默认要求至少出现 2 次;另外遇到「的」「了」这类高频虚词粘连时会产生「的时候」这样的伪词,靠停用词表挡掉一部分。要求高的场景建议配合「额外排除的词」手工修一遍。
- 英文与数字
- 英文按字母和撇号切词,默认忽略大小写并过滤掉 the / is / of 这类停用词;不做词形还原,所以 run 和 running 会分别计数。纯数字默认不统计,因为在日志类文本里往往是噪声。
- 「整行去重计数」怎么用
- 把日志、URL 列表、搜索词导出文件整段贴进来,按整行统计重复次数,等价于命令行里的
sort | uniq -c | sort -rn。找出重复最多的报错行或访问最多的路径时很顺手。 - 占比是按什么算的
- 词频表里的占比 = 该词出现次数 ÷ 参与统计的词条总数。做 SEO 关键词密度时通常看的是「关键词字数 ÷ 全文字数」,两者口径不同,本页在汇总区里把两个数都给了。
- 相关工具
- 字数统计、关键词密度、文本排序、文本去重。