处理机器人或内部访问干扰,核心结论是:先判断干扰是“已知且可枚举”还是“持续变化且难穷举”,前者优先用过滤规则直接剔除,后者优先用标记隔离并在分析时排除。两者不是互斥关系,但落点不同——过滤改的是数据本身,标记改的是数据的使用方式。选错方案的典型代价是:该保留的真实流量被删掉,或者内部访问反复污染报表,导致渠道对比和转化判断长期失真。
在动手之前,需要把干扰源分成三类,因为它们的处理方式完全不同:
判断依据要落在可核对的证据上,而不是凭感觉。可以交叉看三处:
过滤的思路是在数据进入报表前就把符合条件的访问排除。常见做法包括:
robots.txt或访问控制限制已知爬虫,但注意robots.txt只是约定,不遵守的爬虫依然会访问。适用条件:干扰源稳定、可枚举,比如固定办公IP、固定监控工具。此时过滤干净、报表直接可用。
风险:一旦员工出差、家庭宽带变动,或爬虫更换IP与User-Agent,过滤就会失效,甚至误伤真实用户。因此过滤规则需要定期复核,不能设完就不管。
标记的思路是不删除数据,而是给可疑访问打上标签,比如通过自定义维度、事件参数或受众分组,把内部访问、疑似机器人单独归组。分析时用过滤器或分段排除这些标签,原始数据仍然保留。
适用条件:干扰源持续变化、难以穷举,或者你还需要用这些数据做反爬监控、异常告警。此时标记比过滤更安全,因为误判可以随时回滚。
具体做法:
traffic_type=internal。验收信号:排除标记后,主要渠道的转化率、平均停留时间是否回到合理区间;内部IP列表更新后,标记是否同步生效;原始数据是否仍可追溯。
可以用一张判断清单来决策:
实践中常见组合是:对固定办公IP和已知监控工具用过滤,对疑似刷量和伪装爬虫用标记。这样既保证报表干净,又不丢失排查线索。
无论选哪种方案,都要设一个观察周期,对比处理前后同一渠道的会话数、转化数和停留时间。如果处理后真实用户的转化反而下降,说明规则误伤,需要放宽条件。示例:假设某站点排除办公IP后,自然搜索转化率从明显偏低回到正常区间,且订单来源分布更合理,这可以作为过滤生效的信号;若排除后自然搜索会话数骤降而订单不变,则要检查是否误排了真实用户网段。
下一步建议:先导出最近30天的访客明细和服务器日志,按IP频次和User-Agent排序,圈出前20个可疑来源,再对照上面的清单决定哪些走过滤、哪些走标记。规则上线后保留原始数据至少一个完整周期,便于回滚和复核。