云服务器监控告警配置:别等用户投诉才知道服务器挂了

去年一个客户,周五下午数据库磁盘写满了,业务全停。但监控告警没有响,因为阈值设了90%,而磁盘从85%到100%只用了不到一小时。运维人员发现的时候,已经是用户投诉电话打进来之后了。
“监控不是有吗?”他问。
监控有,但告警没配好。
01 为什么需要监控告警?
在云原生架构下,应用系统由成百上千个微服务和实例构成,运维团队无法一直紧盯监控大屏手动巡检所有指标。告警的价值在于:把分散的监控数据转化为明确的、可处理的事件,让运维从被动响应故障转变为主动管理风险。
没有告警的监控,等于没有监控。 监控告诉你“现在是什么情况”,告警告诉你“现在需要你行动”。
02 哪些指标值得监控?
不是所有指标都要告警,但以下几类必须覆盖。
系统层指标:
CPU使用率:持续超过80%告警
内存使用率:持续超过85%告警
磁盘使用率:80%告警,90%紧急——磁盘写满的速度可能比想象中快
网络带宽:接近上限时告警
云厂商主机监控支持采集CPU、内存、磁盘和网络等40余种监控指标,数据采集频率可达到1分钟1次。
CPU使用率:可设70%为告警阈值,连续3次超过阈值后触发
RDS CPU使用率:同样70%告警
磁盘使用率:提前设置80%告警、90%紧急
03 告警分级
告警不分级,等于没有优先级。华为云AOM支持按严重级别(紧急、重要、提醒)对告警事件进行分级管理,不同级别可配置差异化的处理流程,确保关键问题优先处理。
| 级别 | 定义 | 响应要求 | 通知方式 |
|---|---|---|---|
| P0(紧急) | 服务不可用 | 立即处理 | 电话+短信 |
| P1(重要) | 性能严重下降 | 快速响应 | 短信+邮件 |
| P2(提醒) | 资源预警 | 工作时间处理 | 邮件 |
04 告警配置步骤
1. 安装监控Agent
云厂商的基础监控自动开启,但操作系统级监控(内存、磁盘IO等)需要安装Agent才能采集。数据采集频率从基础监控的5分钟提升到1分钟,异常发现更快。
2. 创建告警规则
进入云监控控制台,选择目标资源,设置告警规则。支持多种通知方式:短信、邮件、电话、企业微信、钉钉、飞书等。
3. 配置通知渠道
建议区分不同级别的告警使用不同通知渠道:P0用电话+短信,P1用短信+邮件,P2用邮件。
写在最后
那家客户后来重新配置了告警规则:磁盘使用率80%告警、90%紧急,CPU超过80%持续5分钟告警,并打通了钉钉通知。下一次磁盘写入异常时,他们提前2小时收到了告警,及时扩容,业务没有中断。
告警配置花半小时,能避免半夜爬起来救火。你的服务器监控告警,配好了吗?