不能只凭“排除后总量下降”就认定删对了。更稳妥的做法是:先固定一份可回溯的排除名单,再对同一时间切片做前后对比,重点看被删记录里是否混有真实访问的特征。如果被删部分里出现了正常用户才有的行为链,就说明过滤规则过宽,需要回退或拆分,而不是继续扩大排除范围。
常见情形是:在小样本里,某条规则看起来只命中内部访问,比如按IP段、设备标识或登录态排除。样本阶段命中列表短,人工扫一眼都像内部流量,于是直接全量套用。规模化之后,问题出现在边界上——同一IP段里可能包含办公网络之外的访客,同一设备标识可能被多人共用,登录态的判定也可能把测试账号和真实用户混在一起。
这时会出现一个反直觉结果:排除操作让“内部流量”下降,但真实访问的转化路径也跟着变少。若只看总量,很容易把它解释成“本来就有水分”。真正要问的是:被删掉的记录,是否具备真实访问才有的连续行为。
第一种解释是规则确实命中了内部来源。它的证据通常表现为:被删记录集中在固定网段、固定设备、固定账号,访问时间与工作时段高度重合,且行为路径短、重复度高,缺少跨页面或跨会话的自然延伸。
第二种解释是规则误伤了真实访问。它的证据方向相反:被删记录里出现来自同一网段但行为模式分散的会话,或者设备标识相同却对应不同落地页、不同停留节奏。此时“同IP”“同设备”只是共享特征,不等于同一主体。
能区分这两种解释的关键,不是看排除前后总量差了多少,而是看被删集合内部是否仍然存在行为分层。如果被删集合里既有明显内部特征,又有正常访问特征,说明规则粒度太粗,不能整段删除。
建议把排除动作拆成三步,每一步都留下可复查的记录。
这个动作的结果会直接影响下一步:如果被标记记录几乎全是内部特征,可以进入正式排除;如果混有真实访问,则应把规则从“整段排除”改为“按会话排除”或“按账号排除”,缩小打击面。
假设某站点按一个C段IP排除内部访问,样本期该C段只有两台办公机。全量应用后,发现该C段里还包含一个外部访客,他通过该网络访问了产品页并完成了两次页面跳转。此时若直接看总量,只会看到访问数下降;但抽查被删会话时,能看到这个访客的落地页和后续路径与办公机明显不同。
这个例子的数字仅用于说明比较方法:样本期的“干净”不代表全量期的“干净”。判断依据应是行为链差异,而不是样本期命中数量少。
即使完成了上述对比,也不能单凭站内统计还原搜索算法或第三方估算口径。站内日志、搜索引擎报告和第三方估算的统计口径本来就不同,排除内部流量只能修正站内口径,不能用来推断外部平台的展示或点击逻辑。
另外,请求量或抓取量归零也不能单独证明排除正确,它可能来自采集延迟、日志轮转或规则误伤。真正可用的证据链是:被删记录的行为特征、排除前后的同切片对比、以及抽查结果能否支持“内部为主”这一判断。只有这些条件同时成立,排除动作才具备可回退的依据。