关键词密度多少合适?这个数字能说明什么,不能说明什么
不少 SEO 插件会在关键词占比达到某个百分比时亮绿灯,也有很多人搜索「关键词密度 多少合适」。Google 已经说过,不存在理想的关键词密度,所以任何固定的目标值都是编出来的。密度仍然有用,它的用处是帮你发现自己没有意识到的重复。
密度是怎么算出来的
密度等于某个词出现的次数除以文本里词的总数。一篇 1000 词的英文文章里「email marketing」出现 8 次,词组密度是 0.8%。同一篇里单词「email」出现 15 次,单词密度是 1.5%。
有两个细节会改变结果,却很少有人说明:
- 分母算什么。 如果分母是全部词,数字会比先去掉 the、of 之类停用词之后低。两个工具对同一段文字给出不同的数,不一定有谁算错。
- 重叠。 词组由单词组成,这些单词本身也被单独计数。在一句「email marketing tools help email marketing teams」里,「email」作为单词出现两次,「email marketing」作为词组也出现两次,两者占用的是同一批文字。所以不同表格里的百分比不能相加。
这个关键词密度检查工具里,每一行都用整段文本的总词数做分母,不管停用词有没有被从表里隐藏。隐藏只改变你看到的行,分母不动,所以在筛选后的表里读到的密度,和不筛选时是同一个数。
先说结论:没有目标值
像「2%」这样的数字在网上流传,是因为写进检查清单很方便。搜索引擎没有公布过密度数字,并且多次说过不存在理想密度。Google 有文档说明的是反过来的问题:它的垃圾内容政策把关键词堆砌描述为,为了操纵排名而在页面里塞进大量关键词或数字,比如把同样的词重复到文字读起来不自然。
所以密度的作用偏向防御。某个短语的数值高得离谱,是提醒你把正文重新读一遍;数值正常,也不能说明页面会有排名。自然的写作会反复提到核心词,同时也会用同义词、相关词和代词,而这种搭配,密度表是量不出来的。
密度表真正适合做什么
找出你用得太多的短语。 草稿被一段一段改过之后,某个短语可能每段都出现。两词表和三词表会把它排到最前面,旁边是次数。再看这几行前后的句子,通常能发现哪些地方可以换成「它」「这种做法」或更短的说法。
对照选题检查草稿。 如果一篇页面要写「发票模板」,而这个短语没有出现在靠前的行里,反倒是「免费下载」排在前面,说明草稿跑题了。这样发现偏题,比盯着一个百分比靠谱。
查看竞品页面或你自己上线的页面。 把页面源码粘进来,打开「从 HTML 提取正文」。工具会解析标记,去掉脚本、样式、模板和 SVG 的内容,再统计可见文字,并告诉你剥离了多少字符的标签和脚本,你能确认提取确实生效了。注意:如果导航和页脚的文字也在同一份 HTML 里,它们同样会被统计进去。
发现模板文字。 「加入购物车」、Cookie 提示、每页都有的页脚文字,在长页面里会爬到表格前列,稀释真正的主题词。看到它们被统计出来,也就能解释为什么主题词的密度看起来偏低。
停用词会改变你看到的内容
不去除停用词时,英文表格最前面是 the、of、and、to。打开「去除停用词」后,这些行会被隐藏,包含停用词的两词短语,以及以停用词开头或结尾的三词短语,也一起被隐藏。这个开关有用,但有副作用:「to be or not to be」会整句消失,一个恰好是停用词的品牌名也会消失。如果你期待的词没有出现,先把这个开关关掉,再下结论说文本里没有它。
工具还有「仅显示 ≥2 次」的开关。只出现一次的短语不算重复,隐藏之后要读的列表会短很多。
中文:看的是字组,不是词
中文书写没有空格,要正确切词需要词典和分词模型。这个工具不假装自己做到了。对中文,它统计的是重叠的 2 字组和 3 字组。比如一段连续的「搜索引擎优化」,会产生「搜索」「索引」「引擎」「擎优」「优化」,以及旁边的 3 字组。其中有些是真正的词,有些只是相邻造成的巧合,比如「搜索引擎」里的「索引」。
由此带来三点需要明白的事情:
- 一个字组的次数,说明的是这几个字有多少次紧挨在一起,而不是某个词被使用了多少次。
- 分母是英文单词数加中文字符数,因此中文的占比是字符占比,与「词占比」是不同的量。举例:一篇 2000 个汉字的文章里,某个 2 字组出现 10 次,表里显示 0.50%,虽然它实际覆盖了大约 1% 的汉字。
- 打开去除停用词时,以「的」「了」这类常见功能字开头的字组会被跳过。这是一个经验规则,不是语言学判断。
对中文页面,这张表仍然能完成最主要的工作:某个字组的出现次数远高于其他字组时,就该回头重读那一段。中文里的 3 字组和 2 字组会互相包含,所以不要把它们的次数相加,也不要因为某个 2 字组数值高就认定「这个词」被过度使用,先看看它是否只是更长词语的一部分。
易读性指标
工具还会给出句子数和平均句长。Flesch Reading Ease 分数只有在英文词占比至少 80%、而且词数足够时才显示,因为这个公式依赖音节数和用空格分隔的词。音节是根据元音字母组估算的,所以分数只是一个粗略的区间;中文文本不显示这个分数。对中文,更应该看的是「平均每句字符数」,工具按 14 个以内、30 个以内、更长三档给出提示,这只是一个粗略的参考档位。
一个简短的工作流程
- 粘贴正文,或者打开提取开关后粘贴页面源码。
- 看单词、两词、三词(中文看字组)表格靠前的五行。这些行能否描述这篇内容的主题?
- 如果某个短语的次数远远高于其他项,就找出它的每一处出现,改写其中一部分。
- 把去除停用词关掉看一次,确认没有重要的词被隐藏。
- 到此为止。排名取决于页面是否有用、是否符合搜索的人想要的内容,密度表回答不了这个问题。