JOTO
联系我们
← 资讯中心
技术架构

AIOps落地:基于WorkBuddy+ Prometheus MCP 的智能运维实践

2026 年 8 月 6 日 · JOTO 团队 · 4 分钟阅读

本文介绍一种基于WorkBuddy AI Agent平台与Prometheus MCP服务的AIOps落地实践。通过集成自定义Prometheus MCP、创建“监控专家”Agent,实现自然语言驱动的性能巡检、Pod/Node健康分析、告警根因定位等运维任务。文中详述MCP部署、WorkBuddy连接器配置及专家创建全流程,并提供多个实际使用示例。

核心思路与架构设计

WorkBuddy虽然是商业AI Agent,但它的能力还是非常不错的。它可以集成自定义MCP,它也有丰富的Skill资源,也可以自定义“专家”。这个“专家”你可以理解为就是一个自定义的Agent。

最重要的是,现阶段可以白嫖Hy3大模型,这个还是非常香的!

本案例,我就是先创建了Prometheus MCP,然后定义了一个“监控”专家。后续所有监控相关操作都是通过这个“专家”来做。

MCP服务部署与WorkBuddy集成

步骤 1: 准备Prometheus环境
这里假设你已经搭建好Prometheus服务,并做好了各种exporter(如,node_exporter)和k8s各监控资源的接入。

步骤 2: 部署 Prometheus MCP Server

目前提供Prometheus mcp服务的开源项目并不少,我找了一个亲测可用的项目,地址为:https://github.com/tjhop/prometheus-mcp-server

它的README里提供了详细的部署步骤,你可以根据你的使用场景来选择不同的安装方法,我这里使用的是docker的方式启动服务:

docker run -d -p 8080:8080 ghcr.io/tjhop/prometheus-mcp-server:latest --prometheus.url "http://172.17.0.1:9090" --mcp.transport "http" --web.listen-address ":8080"

注意,需要在Prometheus那台机器上运行该容器,并且我这里假设Prometheus是二进制方式启动,并非容器化,172.17.0.1为宿主机docker0的ip,这样容器内部可以通过该ip访问到宿主机。

步骤 3: 在 WorkBuddy 中配置 MCP 工具

在左侧菜单栏点击“专家.技能.连接器”,再选择“连接器”,再点击右上角的“自定义连接器”,点击“配置MCP”。

写入如下配置:

{
  "mcpServers": {
    "prometheus-mcp": {
      "type": "http",
      "url": "http://192.168.186.150:8080/mcp",
      "headers": {
        "Authorization": "Bearer notoken"
      },
      "disabled": false
    }
  }
}

点击保存,然后返回MCP列表,点击“信任”。

稍等几秒钟,就可以看到它给我们展示出来24个工具。

创建监控专家Agent

左侧点击“专家.技能.连接器”,选择“专家”,创建专家,直接用自然语言创建:

expert-manager 帮我创建一个 prometheus监控专家,能够根据用户自然语言意图,自动分析、组合 PromQL,并通过 prometheus-mcp 工具调用进行查询。
任务包括但不限于:
- 性能巡检(CPU、内存、磁盘、网络)
- Pod / Node 健康分析
- 告警根因定位
- 指标趋势分析
- 指标对比 / 环比
如果需要查询 Prometheus,请你主动调用相应的 MCP 工具。
请在给出结论时说明推理逻辑,输出可执行建议。

新版本创建专家非常慢,之前也就两三分钟,现在花了20多分钟,看样子是增强了能力。

专家使用与典型场景验证

点击左侧“专家.技能.连机器”,点击“专家”,再点击右上角“我的专家”,找到“Prometheus监控专家”。

点击立即使用。

示例1. 列出工具

你可以做哪些事情,请把你能使用的工具列一下

示例2. 查看target

目前有哪些target

示例3. 巡检

帮我分析一下192.168.186.150这台机器各硬件指标情况(CPU、内存、硬盘),只分析过去一小时
即可,我只需要最终的结果,我不需要过程。

JOTO 企业落地观察

  • 企业部署此类基于MCP协议的AI运维助手时,需重点评估其对现有Prometheus生态的兼容性与扩展成本,而非仅关注Agent平台本身能力。
  • 当运维团队缺乏PromQL编写能力时,“自然语言→PromQL→执行”的链路虽降低门槛,但也隐含指标语义歧义风险,需配套建立指标命名规范与业务语义映射表。
  • WorkBuddy作为商业Agent平台,其MCP集成能力为企业提供了快速构建垂直领域专家的路径,但长期演进需关注MCP标准成熟度及跨厂商工具互操作性。
  • 该实践未涉及RAG知识工程,表明当前AIOps智能体仍高度依赖结构化监控数据源;若需融合非结构化运维文档,则必须引入独立的知识注入与检索模块。
想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
联系我们

开启企业级 AI 落地

留下你的行业、部门和当前痛点,我们会在 1 个工作日内与你联系,帮你判断适合先做什么、需要准备哪些数据、适合什么平台。

微信咨询
扫码添加,一对一沟通
JOTO 微信咨询二维码
致电我们
+86 (021) 6566 1628
发送邮件
jotoai@jototech.cn

填写需求单

收到你的信息后,我们将在 1 个工作日内与你取得联系。