监控告警也能开口问 AI,Grafana 官方 MCP 服务器把运维数据接进对话

机房里的监控体系运转起来后,新的麻烦是数据分散:仪表盘在 Grafana、指标在 Prometheus、日志在 Loki、值班表在 OnCall,排查一个告警要在四五处来回翻。Grafana 官方组织开源的 mcp-grafana(Apache-2.0 协议,Go 实现)把这些一并接进 MCP:AI 客户端连上之后,搜仪表盘、跑查询、查告警、看排班都能在对话里完成。要求 Grafana 9.0 及以上版本,自建实例与 Grafana Cloud 都能接。

它能做什么

  • 仪表盘工具组:按标题、文件夹、标签、收藏状态搜板;看板摘要只给标题、面板数、变量等概要,省上下文;还支持用 JSONPath 表达式只取仪表盘的某个局部,以及补丁式修改——不用整板 JSON 来回搬运
  • 指标日志都能查:对 Prometheus 数据源跑 PromQL 即时与区间查询,直方图分位数 p50 到 p99 一个工具算好;对 Loki 跑日志与指标两类查询,还能拉日志模式识别常见结构与异常
  • 统一 SQL 工具:MySQL、PostgreSQL、MSSQL、ClickHouse、Snowflake、Athena 一套工具通查;查询经 Grafana 数据源插件走,认证由数据源配置承担,MCP 服务器全程不经手凭证
  • 告警与值班:告警规则的查看、新建、修改、删除,通知策略与联系点管理;OnCall 的排班表、班次详情、当前当班人、告警组检索
  • 事件管理:Grafana Incident 事件的搜索、创建与更新,把应急处置记录进流程
  • 运维周边一整套:注释与快照管理、面板渲染成 PNG 图片(需另装图像渲染服务)、生成指向仪表盘与面板的深度链接、校验 provisioning 仓库里的配置文件
  • 权限与裁剪:服务账号按 RBAC 细粒度授权,可按资源收窄到具体数据源或仪表盘;SQL、CloudWatch、InfluxDB、Elasticsearch 等多类工具默认关闭,用启用参数按需打开,也能整体关掉写操作

怎么获取

GitHub 上 grafana 官方组织的 mcp-grafana 仓库为正源。有 uv 环境的话 uvx 一条命令拉起,配置里指明实例地址与服务账号令牌即可;仓库同时提供 Docker、二进制与 Helm 部署方式,接 Grafana Cloud 把实例地址换成自己的云实例即可,接入细节以仓库 README 为准。

上手怎么用

  1. 先摘要后细看:让 AI 先取看板摘要再定位具体面板,避免整板 JSON 灌满上下文
  2. 告警关联排查:把处于告警状态的规则拉出来,让 AI 顺着相关日志查询找原因,一条链路不出对话
  3. 性能问题算分位数:直方图分位数工具直接给 p95、p99,比手写聚合语句省事
  4. 周报素材自动备:面板渲染成 PNG,配上当周告警组清单,交给 AI 汇总成值班周报
  5. 链接用工具生成:要分享仪表盘位置时用深度链接工具,生成的是准确地址,别让模型自己拼

适合谁用

自建监控体系的中型企业 IT 运维团队;用 Prometheus、Loki 加 Grafana 这套组合的运维工程师;想把告警、值班、日志检索并进 AI 工作流的一线值班人员。