基于Prometheus和Grafana的监控平台之运维告警

[[360999]]

本文转载自微信公众号「JAVA日知录」,作者单一色调 。转载本文请联系JAVA日知录公众号。  

通过前面的文章我们搭建好了监控环境并且监控了服务器、数据库、应用,运维人员可以实时了解当前被监控对象的运行情况,但是他们不可能通过坐在电脑边上盯着DashBoard来发现服务器或应用异常。

这就要求我们需要一个告警功能,当服务器或应用指标异常时发送告警,通过邮件或者短信的形式告诉运维人员及时处理。

今天我们就来聊聊 基于Prometheus和Grafana的监控平台的异常告警功能。

告警方式Grafana

新版本的Grafana已经提供了告警配置,直接在dashboard监控panel中设置告警即可,但是我用过后发现其实并不灵活,不支持变量,而且好多下载的图表无法使用告警,所以我们不选择使用Grafana告警,而使用Alertmanager。

Alertmanager

相比于Grafana的图形化界面,Alertmanager需要依靠配置文件实现,配置稍显繁琐,但是胜在功能强大灵活。接下来我们就一步一步实现告警通知。

告警类型

Alertmanager告警主要使用以下两种:

  • 邮件接收器 email_config
  • Webhook接收器 webhook_config,会用post形式向配置的url地址发送如下格式的参数。
  1. "version""2"
  2. "status""<resolved|firing>"
  3. "alerts": [{ 
  4.   "labels":  < object > , 
  5.   "annotations":  < object > , 
  6.   "startsAt""<rfc3339>"
  7.   "endsAt""<rfc3339>" 
  8.   }] 

「这次主要使用邮件的方式进行告警。」

实现步骤

  • 下载

从GitHub上下载最新版本的Alertmanager,将其上传解压到服务器上。tar -zxvf alertmanager-0.19.0.linux-amd64.tar.gz

  • 配置Alertmanager
  1. vi alertmanager.yml 
  2. global
  3.   resolve_timeout: 5m 
  4.   smtp_smarthost: 'mail.163.com:25' #邮箱发送端口 
  5.   smtp_from: '[email protected]' 
  6.   smtp_auth_username: '[email protected]' #邮箱账号 
  7.   smtp_auth_password: 'xxxxxx' #邮箱密码 
  8.   smtp_require_tls: false 
  9. route: 
  10.   group_by: ['alertname'
  11.   group_wait: 10s  # 最初即第一次等待多久时间发送一组警报的通知 
  12.   group_interval: 10s # 在发送新警报前的等待时间 
  13.   repeat_interval: 1h # 发送重复警报的周期 对于email配置中,此项不可以设置过低,否则将会由于邮件发送太多频繁,被smtp服务器拒绝 
  14.   receiver: 'email' 
  15. receivers: 
  16.   - name'email' 
  17.     email_configs: 
  18.     - to'[email protected]' 

修改完成后可以使用 ./amtool check-config alertmanager.yml校验文件是否正确。

校验正确后启动alertmanager。nohup ./alertmanager &。(第一次启动可以不使用nohup静默启动,方便后面查看日志)

我们只定义了一个路由,那就意味着所有由Prometheus产生的告警在发送到Alertmanager之后都会通过名为 email的receiver接收。实际上,对于不同级别的告警,会有不同的处理方式,因此在route中,我们还可以定义更多的子Route。具体配置规则大家可以去百度进一步了解。

配置Prometheus

  • 在Prometheus安装目录下建立rules文件夹,放置所有的告警规则文件。
  1. alerting: 
  2.   alertmanagers: 
  3.   - static_configs: 
  4.     - targets: ['192.168.249.131:9093'
  5.  
  6. rule_files: 
  7.   - rules/*.yml 

在rules文件夹下建立告警规则文件 service_down.yml,当服务器下线时发送邮件。

  1. groups: 
  2.  - name: ServiceStatus 
  3.    rules: 
  4.      - alert: ServiceStatusAlert 
  5.        expr: up == 0   
  6.        for: 2m  
  7.        labels: 
  8.          team: node 
  9.        annotations: 
  10.          summary: "Instance {{ $labels.instance }} has bean down" 
  11.          description: "{{ $labels.instance }} of job {{ $labels.job }} has been down for more than 2 minutes." 
  12.          value: "{{ $value }}" 

「配置详解」

alert:告警规则的名称。

expr:基于PromQL表达式告警触发条件,用于计算是否有时间序列满足该条件。

for:评估等待时间,可选参数。用于表示只有当触发条件持续一段时间后才发送告警。在等待期间新产生告警的状态为PENDING,等待期后为FIRING。

labels:自定义标签,允许用户指定要附加到告警上的一组附加标签。

annotations:用于指定一组附加信息,比如用于描述告警详细信息的文字等,annotations的内容在告警产生时会一同作为参数发送到Alertmanager。

配置完成后重启Prometheus,访问Prometheus查看告警配置。

  • 测试

关闭node_exporter,过2分钟就可以收到告警邮件啦,截图如下:Alertmanager的告警内容支持使用模板配置,可以使用好看的模板进行渲染,感兴趣的可以试试!

The More

node exporter的一些计算语句

  • CPU使用率(单位为percent)
  1. (avg by (instance) (irate(node_cpu_seconds_total{mode="idle"}[5m])) * 100) 
  • 内存已使用(单位为bytes)
  1. node_memory_MemTotal_bytes - node_memory_MemFree_bytes - node_memory_Cached_bytes - node_memory_Buffers_bytes - node_memory_Slab_bytes 
  • 内存使用量(单位为bytes/sec)
  1. node_memory_MemTotal_bytes - node_memory_MemFree_bytes - node_memory_Cached_bytes - node_memory_Buffers_bytes - node_memory_Slab_bytes 
  • 内存使用率(单位为percent)
  1. ((node_memory_MemTotal_bytes - node_memory_MemFree_bytes - node_memory_Cached_bytes - node_memory_Buffers_bytes - node_memory_Slab_bytes)/node_memory_MemTotal_bytes) * 100 
  • server1的内存使用率(单位为percent)
  1. ((node_memory_MemTotal_bytes{instance="server1"} - node_memory_MemAvailable_bytes{instance="server1"})/node_memory_MemTotal_bytes{instance="server1"}) * 100 
  • server2的磁盘使用率(单位为percent)

 

  1. ((node_filesystem_size_bytes{fstype=~"xfs|ext4",instance="server2"} - node_filesystem_free_bytes{fstype=~"xfs|ext4",instance="server2"}) / node_filesystem_size_bytes{fstype=~"xfs|ext4",instance="server2"}) * 100 
  • uptime时间(单位为seconds)
  1. time() - node_boot_time 
  • server1的uptime时间(单位为seconds)
  1. time() - node_boot_time_seconds{instance="server1"
  • 网络流出量(单位为bytes/sec)
  1. irate(node_network_transmit_bytes_total{device!~"lo|bond[0-9]|cbr[0-9]|veth.*"}[5m]) > 0 
  • server1的网络流出量(单位为bytes/sec)
  1. irate(node_network_transmit_bytes_total{instance="server1", device!~"lo|bond[0-9]|cbr[0-9]|veth.*"}[5m]) > 0 
  • 网络流入量(单位为bytes/sec)
  1. irate(node_network_receive_bytes_total{device!~"lo|bond[0-9]|cbr[0-9]|veth.*"}[5m]) > 0 
  • server1的网络流入量(单位为bytes/sec)
  1. irate(node_network_receive_bytes_total{instance="server1", device!~"lo|bond[0-9]|cbr[0-9]|veth.*"}[5m]) > 0 
  • 磁盘读取速度(单位为bytes/sec)
  1. irate(node_disk_read_bytes_total{device=~"sd.*"}[5m]) 

 

文章来源网络,作者:管理,如若转载,请注明出处:https://shuyeidc.com/wp/126250.html<

(0)
管理的头像管理
上一篇2025-02-24 03:11
下一篇 2025-02-24 03:13

相关推荐

  • BGP线路到底是什么意思呢,有什么优势?

    BGP线路是一种通过边界网关协议实现多运营商网络互联的接入方式,能自动选择最优路径,极大提升跨网访问速度和稳定性,是解决国内南北网络瓶颈的核心方案,什么是BGP线路BGP,全称Border Gateway Protocol,边界网关协议,是互联网核心路由协议之一,它负责在自治系统之间交换网络可达性信息,BGP线……

    2026-07-26
    0
  • 增值电信业务经营许可证对IDC有多重要,如何办理?

    增值电信业务经营许可证是IDC服务商合法运营的核心凭证,它直接决定了机房能否接入骨干网、客户能否放心托管业务,以及服务商自身能否长期稳定发展,许可证是IDC进入市场的硬门槛互联网数据中心业务属于增值电信业务中的B1类,依据工信部《电信业务经营许可管理办法》,任何从事服务器托管、虚拟主机、云服务等业务的企业,必须……

    2026-07-26
    0
  • 站群服务器一个IP放几个网站合适?,怎么选

    站群服务器一个IP放3-5个网站是大多数情况下的最佳平衡点,但具体数量需根据网站权重、内容质量及IP资源成本灵活调整,这个结论基于搜索引擎对同IP站点的关联判定逻辑,以及站群运营的长期实践,如果你刚接触站群,可能会纠结于IP分配,但核心原则是:不要让搜索引擎轻易识别出这些网站属于同一实体,站群IP分配的底层逻辑……

    2026-07-26
    0
  • DDoS攻击和CC攻击有什么区别,怎么防御?

    DDoS攻击和CC攻击最核心的区别在于攻击目标不同:DDoS攻击主要消耗网络带宽和基础设施资源,而CC攻击专门针对应用层逻辑,耗尽服务器CPU和数据库连接数,两者从原理到防御手段完全不同,攻防视角下的本质差异攻击目标:一个砸门,一个撬锁DDoS攻击(分布式拒绝服务)瞄准的是网络层和传输层,通过大量伪造数据包或畸……

    2026-07-26
    0
  • 服务器UEFI和Legacy启动模式有什么区别,哪个好

    UEFI(统一可扩展固件接口)是取代传统Legacy BIOS的现代启动标准,在服务器领域,UEFI凭借更快的启动速度、超过2TB的磁盘支持、安全启动(Secure Boot)以及丰富的预启动网络功能,成为主流服务器的默认配置;而Legacy BIOS作为兼容性模式,仅在需要运行老旧操作系统或特定硬件时保留,U……

    2026-07-26
    0

发表回复

您的邮箱地址不会被公开。必填项已用 * 标注