运维监控告警系统代码生成:Prometheus+Grafana全栈部署与自定义Exporter开发

官方 2 查看 0 有趣 0 复制 0 收藏

提示词描述:

面向中大规模基础设施的监控体系搭建指南,从Prometheus配置到自定义Exporter开发再到Grafana可视化一站式覆盖。适用于运维团队快速建立可观测性能力,减少监控盲区。建议根据实际环境调整采集间隔和告警阈值,生产环境需评估存储容量。

提示语关键词:
AI运维监控,Prometheus配置生成,Grafana Dashboard模板,AI写监控代码,自定义Exporter开发,运维告警规则,可观测性体系搭建
提示词内容:
你是一位可观测性领域的资深架构师,精通Prometheus生态、Grafana可视化、告警规则设计以及自定义Exporter开发,现需要帮我搭建一套完整的运维监控体系。 【监控对象】 - 50台Linux服务器(混合物理机和云主机) - K8s集群(3 master + 20 worker节点) - 中间件:MySQL主从、Redis Cluster、Kafka集群、Elasticsearch - 自研微服务(Go + Java混合技术栈,约80个服务实例) 【请帮我生成以下内容】 Part 1:基础设施监控配置 - 完整的prometheus.yml配置(含scrape_configs、relabel_configs、recording_rules) - node_exporter自定义collector开发示例(Go语言,采集硬件温度、RAID状态、网卡流量细分指标) - 基于ServiceMonitor的K8s服务发现配置 - 告警规则集(覆盖CPU/内存/磁盘/网络/进程各维度,含阈值建议和分级策略) Part 2:中间件监控Exporter - MySQL自定义Exporter(Python实现,采集慢查询统计、锁等待、连接池使用率、主从延迟等) - Redis Cluster监控(slot分布、内存碎片率、大key检测、热key统计) - Kafka消费者Lag监控及分区均衡度检测 Part 3:应用层APM集成 - OpenTelemetry SDK接入代码示例(Go和Java各一份) - 自定义Span Attribute规范(含业务维度标签) - Trace与Metrics关联方案( Exemplars实现) - 服务依赖拓扑自动生成脚本 Part 4:Grafana Dashboard模板 - 输出3个核心Dashboard的JSON配置: * 全局概览看板(集群健康度、核心SLI指标、告警统计) * 服务下钻看板(单服务P99延迟分解、依赖调用链、资源利用率) * 容量规划看板(资源趋势预测、成本归因、利用率热力图) Part 5:告警路由与OnCall机制 - Alertmanager配置(路由树、抑制规则、静默策略) - 与PagerDuty/飞书/钉钉集成的Webhook代码 - 告警收敛与去重逻辑实现 - OnCall排班自动化脚本 【交付标准】 - 所有配置经过yamllint校验 - 提供docker-compose一键部署方案 - 包含PromQL常用查询手册(20+实用查询) - 给出监控盲点检查清单和容量规划建议
返回列表
相关提示词推荐

提示词排行榜