先给有条件的结论:如果免费版只给出总词数、总字数或一个密度百分比,却缺少词频明细、分词位置或排除规则,那么你不该直接换工具,而应先用可复现的本地计数补出缺失字段,再把两份结果放在同一口径下对照。只有当你能说明缺失字段是什么、由谁按什么规则计算,补充证据才成立;否则补出来的数字只是另一份无法核对的估算。
免费版常见缺失字段可以分成三类。第一类是计数依据,例如是否把标题、正文、导航、页脚分开统计;第二类是分词规则,例如中文按字、按词还是按二元组切分;第三类是排除规则,例如是否剔除停用词、品牌词、标点或数字。三类字段对结果的影响完全不同。
如果缺的是计数依据,补充动作是手动圈定统计范围,把同一段文本复制到纯文本编辑器,只保留你要核对的部分,再记录字符总数。如果缺的是分词规则,补充动作是先确定一种切分方式,例如中文按二元组或按空格分词,然后固定下来,不要中途更换。如果缺的是排除规则,补充动作是列出你主动剔除的词表,并把它和原始计数一起保存。
这一步的产出不是“更准的数字”,而是一份可被别人按同样步骤复现的计数记录。记录里至少要有:文本来源、截取范围、切分方式、排除项、计算日期。缺少其中任何一项,后续对照都会失去意义。
假设你手头有一段约八百字的商品说明,免费版只显示“目标词密度 2.1%”,没有给出目标词出现次数和所在位置。你可以先复制这段文本到本地,去掉图片说明和导航文字,只保留正文。然后按你选定的切分方式逐段标记目标词出现的位置,例如第几段、第几次出现。最后用出现次数除以你圈定的总词数或总字数,得到自己的密度值。
这个例子是假设,不是真实项目结果。它的价值在于把“一个百分比”拆成“次数、位置、分母”三个可核对字段。若免费版显示 2.1%,而你本地按同一范围算出 1.6%,差异可能来自三处:免费版把标题也算进分母;免费版把目标词的复数或近义形式一并计入;免费版没有剔除停用词。你不需要立刻判断谁对,而是先把这三处逐一排除。
实际动作是:先复制免费版结果并截图或记录数值,再在本地按固定规则重算一次,最后把两份结果并排。这个动作的结果会直接影响下一步——如果差异能由范围或排除规则解释,就继续用免费版并附上你的口径说明;如果差异无法解释,才需要考虑换工具或改用人工抽查。
可核对证据不要求你拿到工具的源代码,只要求你留下别人能复查的痕迹。建议固定补三项:
这三项证据的作用是让“密度”从单一结论变成可讨论的过程。如果后续有人质疑你的数字,你可以直接展示快照和规则,而不是重新解释一遍。
上面的做法有一个明确的反例:如果免费版缺少的字段恰好是分词边界,而你的文本又大量依赖中文词语组合,那么本地按字统计出的密度和工具按词统计出的密度可能都不算错,却无法互相换算。例如“关键词密度工具”按字统计是七个字符,按词统计可能是一个词或两个词;两种口径下的分母和分子同时变化,百分比差异会被放大。
在这种情况下,继续对照两个百分比没有意义。你应当停止比较数值,改为只核对出现位置和上下文,或者统一改用同一种切分方式重新统计全文。若你无法确定工具实际采用哪种切分方式,就不要声称本地结果“纠正”了工具结果,只能说两者口径不同。
集中处理一个遗漏条件即可:先确认免费版缺少的到底是计数范围、分词规则还是排除项,然后只补这一项,不要同时改动其他变量。补完后做一次最小对照,记录一致和不一致的地方。如果补充证据后差异仍然存在,且你能排除范围、分词和排除规则三种解释,再考虑更换工具或改用手工抽查。这个顺序能避免把“口径不同”误判成“工具算错”,也能让后续每一次统计都有据可查。