STAROps 面向未知异常发现的日志智能巡检架构实践
出处:
mp.weixin.qq.com
很多人查日志,都是从一条告警开始的。接口报错了,先搜 Request ID;Pod 重启了,去找退出前的异常堆栈;用户反馈支付失败,再拿着账号和订单号回查调用过程。此时问题已经发生,日志帮助我们还原现场。但日志里留下的东西远不止故障现场。应用日志记录业务执行过程,访问日志反映流量和服务质量,审计日志记录谁在什么时间做了什么操作,Kubernetes Event 记录资源状态变化。研发用它排障,安全团队用它审计,运营团队也可以从中发现支付、库存、设备或用户行为的异常。真正容易被忽略的,是那些还没有触发告警、也没有人主动搜索的变化:一个新版本开始零星出现从未见过的异常堆栈;整体错误率看起来正常,某个 Region 却在持续恶化;一类高风险操作第一次出现在非授权时间。单独看,这些信号可能并不起眼。继续发展下去,它们也可能成为下一次大面积故障的起点。日志智能巡检要做的,是在没人提问的时候主动看一遍,并告诉我们:这里出现了一个过去没有的变化,值得现在就查。