核心交换机中断后,监控平台同时收到链路、服务器、应用和接口不可达等数百条告警,值班人员难以定位根因。较合理的治理方式是()。
告警风暴治理应保留监控能力,通过去重、聚合、依赖拓扑、维护窗口和抑制规则,把同一根因产生的大量派生告警归并,帮助值班人员先处理关键故障。
选项分析
错误。关闭监控会失去故障发现能力,属于因噎废食。
正确。去重、关联和拓扑抑制能降低噪声并保留根因线索。
错误。全部最高级会破坏优先级体系并放大通知疲劳。
错误。随机删除无法解释,也可能丢掉真正的根因告警。
本题为什么容易错
告警越多不代表监控越好。关键是每条告警是否可行动,以及多条信号之间能否形成清晰的故障关系。
简短答案
一台核心交换机故障引发数百条下游告警,应该怎样减少告警风暴,正确答案是 B(按时间、对象和拓扑关系去重关联,突出根因告警并抑制派生告警)。告警风暴治理应保留监控能力,通过去重、聚合、依赖拓扑、维护窗口和抑制规则,把同一根因产生的大量派生告警归并,帮助值班人员先处理关键故障。
易混淆概念对比表
| 概念 | 本题判断 | 区别要点 | 记忆提示 |
|---|---|---|---|
| 永久关闭全部监控,避免再产生告警 | 本题干扰项 | 错误。关闭监控会失去故障发现能力,属于因噎废食。 | 看到该词不要急着选,先判断是否真正解决题干问题 |
| 按时间、对象和拓扑关系去重关联,突出根因告警并抑制派生告警 | 本题正确答案 | 正确。去重、关联和拓扑抑制能降低噪声并保留根因线索。 | 看到题干核心场景时优先联想到它 |
| 把每条告警都升级为最高级别并分别电话通知 | 本题干扰项 | 错误。全部最高级会破坏优先级体系并放大通知疲劳。 | 看到该词不要急着选,先判断是否真正解决题干问题 |
| 随机删除一半告警,不保留任何规则和记录 | 本题干扰项 | 错误。随机删除无法解释,也可能丢掉真正的根因告警。 | 看到该词不要急着选,先判断是否真正解决题干问题 |
本题易混淆选项怎么区分
- 永久关闭全部监控,避免再产生告警:错误。关闭监控会失去故障发现能力,属于因噎废食。
- 把每条告警都升级为最高级别并分别电话通知:错误。全部最高级会破坏优先级体系并放大通知疲劳。
- 随机删除一半告警,不保留任何规则和记录:错误。随机删除无法解释,也可能丢掉真正的根因告警。
知识点详解
告警风暴常由依赖链故障、阈值抖动、重复采集或配置错误引起。治理手段包括去重、时间窗口聚合、拓扑关联、维护抑制、迟滞阈值和通知分级。平台应保留原始事件,记录规则命中原因,并持续评估误报、漏报和告警可行动性。没有可靠配置关系时,所谓根因推断也可能出错,因此自动抑制要有边界和人工回看能力。
备考速记
压的是重复通知,不是原始事实;先亮根因,再收拢症状。
监控运维在监控运维场景中的作用
监控运维在本题中的核心价值,是解决“核心交换机中断后,监控平台同时收到链路、服务器、应用和接口不可达等数百条告警,值班人员难以定位根因。较合理的治理方式是()”这个场景问题。复习时不要只背选项名称,还要理解它为什么适用于该场景,以及它能解决哪类安全、流程或管理问题。
同类题怎么考
- 一个基础设施故障触发大量应用告警。
- 判断告警去重、抑制、聚合和根因关联的用途。
监控运维在信息系统管理工程师软考中的考法
软考选择题通常不会只考概念定义,还会把监控运维放到监控运维场景中,要求判断它的作用、适用范围或与相近概念的区别。遇到这类题时,先抓住题干中的业务场景,再看哪个选项最能解决该场景下的核心问题。
解题思路
核心交换机一断,下游几十个系统都会说“我不通了”,但真正需要先修的可能只有交换机这一处。平台应利用拓扑和时间关系,把派生告警挂到根因事件下,值班页面突出一条关键告警,而不是让人处理数百张重复工单。原始数据仍可保留,抑制的是噪声通知,不是事实。
考点定位
减少噪声不是删除证据。好规则要压缩重复通知,同时保留原始事件和关联链路,确保能审计、回放和调优。
易错提醒
- 抑制规则只按文本匹配,设备改名后大量漏判。
- 维护窗口结束后忘记恢复告警或核对遗留故障。
- 没有统计压缩率、误抑制和未处理时长,规则长期不优化。
备考提示
- 按根因告警、症状告警、重复告警分三类看样例。
- 把告警治理与事件优先级、CMDB依赖关系和自动化工单联动复习。
你可能还想了解
- 告警去重和告警抑制有什么区别?
- 如何避免误抑制真正故障?
- CMDB拓扑怎样帮助根因告警分析?
本文小结
核心设备故障引发大量下游告警时,应按时间、对象和拓扑进行去重关联,突出根因并抑制重复通知,同时保留原始事件用于审计和复盘。