告警风暴:运维团队的"狼来了"
凌晨 3 点,空压机短暂过载——电流瞬间超过阈值 3 秒后恢复正常。就这么一个瞬态波动,触发了 17 条告警:电流越限 ×1、温度偏高 ×3、振动异常 ×2、关联设备告警 ×5……值班员的手机连续震动了两分钟。
这种场景在工厂运维中并不罕见。问题在于:
告警风暴的三大根源
1. 阈值设置粗暴
很多工厂的告警阈值是在部署时随手设的——"比额定值高 10% 就报"。没有考虑不同工况、不同时段、不同负载下的合理波动范围。
2. 缺乏关联收敛
一台空压机故障会导致气压下降 → 多台备机同时启动 → 电流瞬时增大 → 多台设备同时越限。传统系统把这当成 5 个独立告警发出,而不识别它们是同一根因事件的"涟漪"。
3. 瞬态干扰未过滤
设备启停、电网波动、传感器瞬时跳变——这些秒级甚至毫秒级的波动,不应该触发告警,但传统阈值系统照单全收。
三招降噪:延迟确认 + 时间窗合并 + 分级推送
第一招:延迟确认
短时波动不立即告警,而是进入"观察窗口"。比如电流越限后持续观察 30 秒,如果自动恢复则仅记录日志不推送;如果持续越限则立即告警。这一招能过滤掉 60% 以上的瞬态干扰。
第二招:时间窗合并
设定一个时间窗口(如 5 分钟),窗口内同一设备、同一类型的告警合并为一条。推送内容携带"已触发 8 次,持续 4 分 30 秒"等摘要信息,而非逐条轰炸。
第三招:分级推送
「紧急告警」:设备停机、关键参数严重偏离 → 秒级推送 + 电话追呼
「重要告警」:参数越限但设备仍在运行 → 企微推送,超时升级
「普通提醒」:轻微偏离、趋势预警 → 汇总到日报,无需实时打扰
一个真实的降噪效果
某制造工厂空压机站部署告警降噪策略后:
**告警是工具,不是目的。好的告警系统不是让你知道更多,而是让你只看重要的。**