实战 📋 6 个步骤 第 340 / 470 篇

Amazon OpenSearch MCP Apps:让运维 Agent 把瀑布图、拓扑图画进聊天窗口

8 月 26 日 AWS 宣布 Amazon OpenSearch Service 支持 MCP Apps:MCP 工具调用返回文本之外还能同时返回可交互可视化(trace 瀑布、服务拓扑、日志模式),直接在 IDE 对话窗口渲染,解决「Agent 给结论、人工还得切浏览器验证」的最后一公里。本教程讲架构、配置与告警排障实操。

2026.08.27· 14 分钟阅读· 约 1444 字

8 月 26 日,AWS 宣布 Amazon OpenSearch Service 支持 MCP Apps:当你的 AI 运维 Agent 调用 MCP 工具时,返回的不再只有一段文字结论,而是文字 + 可交互可视化图表——trace 瀑布图、服务拓扑、日志模式直接渲染在对话窗口里。它解决的是智能运维最后一道坎:Agent 几秒给出根因,你还要花几分钟切浏览器去验证。本教程从机制讲起,带你配好并用起来。

📊 本教程适合:DevOps / SRE / 运维平台工程师,以及所有「用 Agent 查告警但还是要人工复核」的团队。需要 AWS 账号与基本 MCP 概念。

Step 1:先搞懂痛点——验证环节还在 Agent 循环之外

1 Agent 省了查询时间,没省你「切浏览器」的时间

现在的智能运维流程是:Agent 查告警、关联日志与链路、给出根因假设——但只要几秒。之后呢?你得离开 IDE、打开运维控制台、手动复跑一遍查询、对着面板比对 Agent 说的对不对。这趟「外部验证循环」才是真正的瓶颈:

典型现状:
1. 问 Agent 告警原因 → 秒回文字假设 ✅
2. 打开浏览器登录运维 UI(换个工具)⏱
3. 手动复跑查询、找 trace 瀑布、看服务拓扑 ⏱⏱
4. 比完再回到 Agent 继续问 → 上下文已丢 ⏱⏱⏱

MCP Apps 之后:
1. 问 Agent → 文字结论 + 图表同时出现在对话里 ✅
2. 在同一个线程里直接看图验证 ✅
3. 图表是真实查询结果渲染的,不是 AI 编的 ✅
💡 一句话:MCP Apps 把「验证」从浏览器搬回对话,Agent 循环不再中断。

Step 2:搞懂机制——MCP 的双通道响应

2 标准 MCP 返回文本,MCP Apps 多返回一维「可视化载荷」

标准 MCP 工具调用:Agent 发 JSON-RPC 请求 → 服务端返回文本 → Agent 纳入推理。MCP Apps 在协议上扩展了第二个响应通道:

你的 IDE(Claude / VS Code / Cursor…)
   │  ① tool call
   ▼
本地 MCP Server(跑在你机器上)
   │  ② 带认证的查询
   ▼
OpenSearch UI(连 domains / serverless /
CloudWatch / Managed Prometheus)
   │  ③ 双通道响应
   ▼
IDE ← 文本摘要 + 可交互图表(trace 瀑布 /
        服务拓扑 / 日志模式视图)

关键点:图表由真实查询结果渲染,结果确定可复现,
不是 AI 对数据的「解读」。

安全边界:MCP Server 跑在本地、数据留在你的 AWS 账号内,认证走你自己的凭据与策略。但它能让 Agent 直达生产遥测——权限和 blast radius 必须提前想清楚(见 Step 5)。

Step 3:环境准备

3 四件套:IDE + MCP Server + OpenSearch UI + 数据源
1. IDE:支持 MCP 的客户端即可
   (Claude、VS Code、Cursor 等)
2. 本地 MCP Server:按 AWS 官方文档安装配置
   → 作为 IDE 与 OpenSearch UI 之间的安全桥
3. OpenSearch UI:统一可观测性界面
   → 连接你的数据源,作为查询与渲染后端
4. 数据源:OpenSearch domains / Serverless
   collections / CloudWatch / Amazon Managed
   Service for Prometheus(任选已有者接入)
💡 没有 AWS 的团队也别走:这套「文本 + 可视化双通道」思路可以自建(见 Step 6),原理同构。

Step 4:数据源接入与首次查询

4 把告警、日志、指标连进来

在 OpenSearch UI 里把数据源配置好后,MCP Server 暴露的运维工具就能查询它们。首次跑通建议用最简单的场景:

1. 确认本地 MCP Server 已启动、IDE 里工具列表可见
2. 选一个数据源(如 CloudWatch 日志组)完成授权
3. 在 IDE 里直接问:
   「过去 30 分钟 error 数量按服务分组,
   给我看错误计数和拓扑」
4. 预期:文字摘要 + 错误计数图表同时出现
5. 点图表交互(hover/缩放)复核数据是否与摘要一致
🚀 这一步跑通,说明你已进入「Agent 出结论、图表帮你秒验证」的新工作流。

Step 5:告警 → 根因 → 可视化验证一条龙

5 真实排障场景走一遍

以一次典型 P1 告警为例,完整链路:

1. Agent 收到告警 → 先问数据源拉告警明细
2. 关联 trace:哪个服务延迟飙升?
   → 返回 trace 瀑布图,肉眼定位慢在哪个 span
3. 展开服务拓扑:影响范围多大?
   → 拓扑图直接显示下游依赖是否被波及
4. 查日志模式:根因是啥?
   → 日志模式视图 + 文字根因假设并排展示
5. 人工核对图表确认 → 提单修复

全程不离开对话窗口,上下文不断档。

别全信 Agent:图表是真实查询渲染,但 Agent 对图表的「解读」仍可能错。黄金法则——看图验证、以图为准。想补 Agent 排障基本功,可看本中心《Oncall 告警处理》与《Nimbus 云运维》两篇。

Step 6:安全治理与扩展思路

6 控制 blast radius,再把玩法复制到别处
治理点建议
权限Agent 用只读角色,仅授查询所需的最小数据源范围
网络MCP Server 仅本机监听,不暴露公网
审计记录 Agent 每次数据源查询,异常访问可追溯
生产保护非关键环境先试点,逐步放开生产遥测读权限

扩展思路:MCP Apps 的「工具返回可视化」模式不只属于 AWS——任何查询型 MCP 工具(成本、监控、CI 状态)都能借鉴,把「结果长什么样」直接交付,而不是交给用户脑补。想在自建框架里落地,可参考本中心《OpenAI Agents SDK》的 MCP 接入章节与《Agent 可观测性》日志评估体系。

🎉 六步走完,你的运维 Agent 从「会说话」升级成「会画图、可验证」——排障效率的质变点就在这。
← 返回教程中心