AIOps落地:基于WorkBuddy+ Prometheus MCP 的智能运维实践
本文介绍一种基于WorkBuddy AI Agent平台与Prometheus MCP服务的AIOps落地实践。通过集成自定义Prometheus MCP、创建“监控专家”Agent,实现自然语言驱动的性能巡检、Pod/Node健康分析、告警根因定位等运维任务。文中详述MCP部署、WorkBuddy连接器配置及专家创建全流程,并提供多个实际使用示例。
核心思路与架构设计
WorkBuddy虽然是商业AI Agent,但它的能力还是非常不错的。它可以集成自定义MCP,它也有丰富的Skill资源,也可以自定义“专家”。这个“专家”你可以理解为就是一个自定义的Agent。
最重要的是,现阶段可以白嫖Hy3大模型,这个还是非常香的!
本案例,我就是先创建了Prometheus MCP,然后定义了一个“监控”专家。后续所有监控相关操作都是通过这个“专家”来做。

MCP服务部署与WorkBuddy集成
步骤 1: 准备Prometheus环境
这里假设你已经搭建好Prometheus服务,并做好了各种exporter(如,node_exporter)和k8s各监控资源的接入。
步骤 2: 部署 Prometheus MCP Server
目前提供Prometheus mcp服务的开源项目并不少,我找了一个亲测可用的项目,地址为:https://github.com/tjhop/prometheus-mcp-server
它的README里提供了详细的部署步骤,你可以根据你的使用场景来选择不同的安装方法,我这里使用的是docker的方式启动服务:
docker run -d -p 8080:8080 ghcr.io/tjhop/prometheus-mcp-server:latest --prometheus.url "http://172.17.0.1:9090" --mcp.transport "http" --web.listen-address ":8080"注意,需要在Prometheus那台机器上运行该容器,并且我这里假设Prometheus是二进制方式启动,并非容器化,172.17.0.1为宿主机docker0的ip,这样容器内部可以通过该ip访问到宿主机。
步骤 3: 在 WorkBuddy 中配置 MCP 工具
在左侧菜单栏点击“专家.技能.连接器”,再选择“连接器”,再点击右上角的“自定义连接器”,点击“配置MCP”。
写入如下配置:
{
"mcpServers": {
"prometheus-mcp": {
"type": "http",
"url": "http://192.168.186.150:8080/mcp",
"headers": {
"Authorization": "Bearer notoken"
},
"disabled": false
}
}
}点击保存,然后返回MCP列表,点击“信任”。

稍等几秒钟,就可以看到它给我们展示出来24个工具。

创建监控专家Agent
左侧点击“专家.技能.连接器”,选择“专家”,创建专家,直接用自然语言创建:





expert-manager 帮我创建一个 prometheus监控专家,能够根据用户自然语言意图,自动分析、组合 PromQL,并通过 prometheus-mcp 工具调用进行查询。
任务包括但不限于:
- 性能巡检(CPU、内存、磁盘、网络)
- Pod / Node 健康分析
- 告警根因定位
- 指标趋势分析
- 指标对比 / 环比
如果需要查询 Prometheus,请你主动调用相应的 MCP 工具。
请在给出结论时说明推理逻辑,输出可执行建议。新版本创建专家非常慢,之前也就两三分钟,现在花了20多分钟,看样子是增强了能力。
专家使用与典型场景验证
点击左侧“专家.技能.连机器”,点击“专家”,再点击右上角“我的专家”,找到“Prometheus监控专家”。

点击立即使用。
示例1. 列出工具


你可以做哪些事情,请把你能使用的工具列一下示例2. 查看target


目前有哪些target示例3. 巡检
帮我分析一下192.168.186.150这台机器各硬件指标情况(CPU、内存、硬盘),只分析过去一小时
即可,我只需要最终的结果,我不需要过程。
JOTO 企业落地观察
- 企业部署此类基于MCP协议的AI运维助手时,需重点评估其对现有Prometheus生态的兼容性与扩展成本,而非仅关注Agent平台本身能力。
- 当运维团队缺乏PromQL编写能力时,“自然语言→PromQL→执行”的链路虽降低门槛,但也隐含指标语义歧义风险,需配套建立指标命名规范与业务语义映射表。
- WorkBuddy作为商业Agent平台,其MCP集成能力为企业提供了快速构建垂直领域专家的路径,但长期演进需关注MCP标准成熟度及跨厂商工具互操作性。
- 该实践未涉及RAG知识工程,表明当前AIOps智能体仍高度依赖结构化监控数据源;若需融合非结构化运维文档,则必须引入独立的知识注入与检索模块。


