运维监控告警系统代码生成:Prometheus+Grafana全栈部署与自定义Exporter开发
提示词描述:
面向中大规模基础设施的监控体系搭建指南,从Prometheus配置到自定义Exporter开发再到Grafana可视化一站式覆盖。适用于运维团队快速建立可观测性能力,减少监控盲区。建议根据实际环境调整采集间隔和告警阈值,生产环境需评估存储容量。
提示语关键词:
AI运维监控,Prometheus配置生成,Grafana Dashboard模板,AI写监控代码,自定义Exporter开发,运维告警规则,可观测性体系搭建
提示词内容:
你是一位可观测性领域的资深架构师,精通Prometheus生态、Grafana可视化、告警规则设计以及自定义Exporter开发,现需要帮我搭建一套完整的运维监控体系。
【监控对象】
- 50台Linux服务器(混合物理机和云主机)
- K8s集群(3 master + 20 worker节点)
- 中间件:MySQL主从、Redis Cluster、Kafka集群、Elasticsearch
- 自研微服务(Go + Java混合技术栈,约80个服务实例)
【请帮我生成以下内容】
Part 1:基础设施监控配置
- 完整的prometheus.yml配置(含scrape_configs、relabel_configs、recording_rules)
- node_exporter自定义collector开发示例(Go语言,采集硬件温度、RAID状态、网卡流量细分指标)
- 基于ServiceMonitor的K8s服务发现配置
- 告警规则集(覆盖CPU/内存/磁盘/网络/进程各维度,含阈值建议和分级策略)
Part 2:中间件监控Exporter
- MySQL自定义Exporter(Python实现,采集慢查询统计、锁等待、连接池使用率、主从延迟等)
- Redis Cluster监控(slot分布、内存碎片率、大key检测、热key统计)
- Kafka消费者Lag监控及分区均衡度检测
Part 3:应用层APM集成
- OpenTelemetry SDK接入代码示例(Go和Java各一份)
- 自定义Span Attribute规范(含业务维度标签)
- Trace与Metrics关联方案( Exemplars实现)
- 服务依赖拓扑自动生成脚本
Part 4:Grafana Dashboard模板
- 输出3个核心Dashboard的JSON配置:
* 全局概览看板(集群健康度、核心SLI指标、告警统计)
* 服务下钻看板(单服务P99延迟分解、依赖调用链、资源利用率)
* 容量规划看板(资源趋势预测、成本归因、利用率热力图)
Part 5:告警路由与OnCall机制
- Alertmanager配置(路由树、抑制规则、静默策略)
- 与PagerDuty/飞书/钉钉集成的Webhook代码
- 告警收敛与去重逻辑实现
- OnCall排班自动化脚本
【交付标准】
- 所有配置经过yamllint校验
- 提供docker-compose一键部署方案
- 包含PromQL常用查询手册(20+实用查询)
- 给出监控盲点检查清单和容量规划建议