8 月 26 日,AWS 宣布 Amazon OpenSearch Service 支持 MCP Apps:当你的 AI 运维 Agent 调用 MCP 工具时,返回的不再只有一段文字结论,而是文字 + 可交互可视化图表——trace 瀑布图、服务拓扑、日志模式直接渲染在对话窗口里。它解决的是智能运维最后一道坎:Agent 几秒给出根因,你还要花几分钟切浏览器去验证。本教程从机制讲起,带你配好并用起来。
Step 1:先搞懂痛点——验证环节还在 Agent 循环之外
现在的智能运维流程是:Agent 查告警、关联日志与链路、给出根因假设——但只要几秒。之后呢?你得离开 IDE、打开运维控制台、手动复跑一遍查询、对着面板比对 Agent 说的对不对。这趟「外部验证循环」才是真正的瓶颈:
典型现状:
1. 问 Agent 告警原因 → 秒回文字假设 ✅
2. 打开浏览器登录运维 UI(换个工具)⏱
3. 手动复跑查询、找 trace 瀑布、看服务拓扑 ⏱⏱
4. 比完再回到 Agent 继续问 → 上下文已丢 ⏱⏱⏱
MCP Apps 之后:
1. 问 Agent → 文字结论 + 图表同时出现在对话里 ✅
2. 在同一个线程里直接看图验证 ✅
3. 图表是真实查询结果渲染的,不是 AI 编的 ✅
Step 2:搞懂机制——MCP 的双通道响应
标准 MCP 工具调用:Agent 发 JSON-RPC 请求 → 服务端返回文本 → Agent 纳入推理。MCP Apps 在协议上扩展了第二个响应通道:
你的 IDE(Claude / VS Code / Cursor…)
│ ① tool call
▼
本地 MCP Server(跑在你机器上)
│ ② 带认证的查询
▼
OpenSearch UI(连 domains / serverless /
CloudWatch / Managed Prometheus)
│ ③ 双通道响应
▼
IDE ← 文本摘要 + 可交互图表(trace 瀑布 /
服务拓扑 / 日志模式视图)
关键点:图表由真实查询结果渲染,结果确定可复现,
不是 AI 对数据的「解读」。
安全边界:MCP Server 跑在本地、数据留在你的 AWS 账号内,认证走你自己的凭据与策略。但它能让 Agent 直达生产遥测——权限和 blast radius 必须提前想清楚(见 Step 5)。
Step 3:环境准备
1. IDE:支持 MCP 的客户端即可
(Claude、VS Code、Cursor 等)
2. 本地 MCP Server:按 AWS 官方文档安装配置
→ 作为 IDE 与 OpenSearch UI 之间的安全桥
3. OpenSearch UI:统一可观测性界面
→ 连接你的数据源,作为查询与渲染后端
4. 数据源:OpenSearch domains / Serverless
collections / CloudWatch / Amazon Managed
Service for Prometheus(任选已有者接入)
Step 4:数据源接入与首次查询
在 OpenSearch UI 里把数据源配置好后,MCP Server 暴露的运维工具就能查询它们。首次跑通建议用最简单的场景:
1. 确认本地 MCP Server 已启动、IDE 里工具列表可见
2. 选一个数据源(如 CloudWatch 日志组)完成授权
3. 在 IDE 里直接问:
「过去 30 分钟 error 数量按服务分组,
给我看错误计数和拓扑」
4. 预期:文字摘要 + 错误计数图表同时出现
5. 点图表交互(hover/缩放)复核数据是否与摘要一致
Step 5:告警 → 根因 → 可视化验证一条龙
以一次典型 P1 告警为例,完整链路:
1. Agent 收到告警 → 先问数据源拉告警明细
2. 关联 trace:哪个服务延迟飙升?
→ 返回 trace 瀑布图,肉眼定位慢在哪个 span
3. 展开服务拓扑:影响范围多大?
→ 拓扑图直接显示下游依赖是否被波及
4. 查日志模式:根因是啥?
→ 日志模式视图 + 文字根因假设并排展示
5. 人工核对图表确认 → 提单修复
全程不离开对话窗口,上下文不断档。
别全信 Agent:图表是真实查询渲染,但 Agent 对图表的「解读」仍可能错。黄金法则——看图验证、以图为准。想补 Agent 排障基本功,可看本中心《Oncall 告警处理》与《Nimbus 云运维》两篇。
Step 6:安全治理与扩展思路
| 治理点 | 建议 |
|---|---|
| 权限 | Agent 用只读角色,仅授查询所需的最小数据源范围 |
| 网络 | MCP Server 仅本机监听,不暴露公网 |
| 审计 | 记录 Agent 每次数据源查询,异常访问可追溯 |
| 生产保护 | 非关键环境先试点,逐步放开生产遥测读权限 |
扩展思路:MCP Apps 的「工具返回可视化」模式不只属于 AWS——任何查询型 MCP 工具(成本、监控、CI 状态)都能借鉴,把「结果长什么样」直接交付,而不是交给用户脑补。想在自建框架里落地,可参考本中心《OpenAI Agents SDK》的 MCP 接入章节与《Agent 可观测性》日志评估体系。