在安全检测平台中确定异常开始时间,核心方法是把“首次出现异常信号的时间”与“异常被确认的时间”分开记录,再用可复核的证据链把两者对齐。异常开始时间应取第一个可复现、可归因的异常信号出现时刻,而不是告警到达时刻或人工发现时刻。多人协作时,这个时间点必须带上时区、数据来源和判定依据,否则后续排查和交付会反复返工。
很多人把这三个时间混为一谈,导致结论对不上:
交付时如果只写“昨天下午发现异常”,接收方无法判断影响范围。正确做法是三个时间都写,并注明哪个是本次判定的异常开始时间。
确定开始时间的可执行步骤如下:
假设某接口在 14:00 开始出现大量异常返回,检测平台 14:20 才告警。回溯日志发现 13:52 有一次配置发布,13:55 起错误率缓慢上升。此时异常开始时间应记为 13:55 左右,而不是 14:20。这个例子是假设,用于说明方法。
满足以下条件,才能把某个时刻定为异常开始时间:
如果只有告警记录、没有原始日志,只能写“告警触发时间”,并注明开始时间待补证。把不确定的时间写成确定结论,是协作返工的主要来源。
要让结论可交付,时间记录至少包含:时区、时间来源系统、记录字段、判定人。建议在检测平台之外单独维护一份时间线表,字段包括时刻、来源、现象、判定。交接时说明哪些时刻已核实、哪些仍是推测。
验收信号可以这样设定:接收方能在不询问原排查人的情况下,根据记录复现出同一个开始时间,并指出候选点之前为何没有更早信号。做不到这一点,说明记录还不完整。
把告警时间当开始时间,会低估影响时长;把最早一条无关日志当开始时间,会高估影响范围。修正方式是始终保留“候选—排除—确认”的过程记录,而不是只留最终结论。第三方估算、平台报告与站内原始日志口径不同,不能互相替代,判定开始时间应以原始记录为准。
下一步:选一个近期已处理的异常事件,按上面的时间线方法重新标注三个时间点,检查记录里是否还缺原始日志或时区说明,把缺失项补齐后再交付。