实战 📋 6 个步骤 第 355 / 470 篇

Warp「/skill-doctor」:给 AI 编程助手做技能体检,一次诊断降本约 30%

Warp 发布 /skill-doctor:抓取 Claude Code、Codex 或 Warp 的会话转录,对效率、代码质量、技能覆盖率打分,并生成可合并的 skill 补丁,声称每次运行成本降约 30%。本教程教你给 Agent 技能做体检。

2026.08.30· 12 分钟阅读· 约 1376 字

终端公司 Warp 最近放出一个很实用的小工具:/skill-doctor。它抓取 Claude Code、Codex 或 Warp 的会话转录,给你的 AI 编程助手做「体检」——对运行效率、代码质量、技能覆盖率三项打分,然后直接产出可合并的 skill 补丁,声称能让每次运行的成本降低约 30%。这篇教程带你上手:技能体检怎么跑、报告怎么读、补丁怎么合。

🩺 本教程适合:重度使用 Claude Code / Codex / Warp 的开发者,以及在企业里推广 AI 编程并关心成本的团队负责人。会跑终端命令即可。

Step 1:先理解它解决什么问题——技能库「只会增不会瘦」

1 技能越多,跑得越慢、越贵
用 AI 编程助手久了都会遇到:
· 技能(skill)攒了几十个,很多从没用过
· 每个任务都全量加载技能 → Token 变贵
· 技能写得烂 → Agent 反复试错 → 更贵
· 想清理又不知道哪些该删、哪些该改

/skill-doctor 的思路:
· 读你的真实会话转录(不是空想)
· 量化打分:效率 / 代码质量 / 技能覆盖率
· 输出可合并的补丁(新增/修改/删技能建议)
· 目标:技能库瘦身提质,单次运行降本约 30%
💡 关键词是「基于真实转录」:它不看你的技能文件好不好,而看「实际用起来」效果如何——这和《Agent 反馈闭环》里「用行为数据说话」的原则一脉相承。

Step 2:它能读什么——三种转录来源

2 Claude Code、Codex、Warp 都支持
来源怎么接入适合谁
Claude Code读取本地会话记录Claude Code 重度用户
Codex读取 Codex 会话记录OpenAI Codex 用户
Warp读取 Warp 终端内 AI 会话Warp 用户

三种来源本质相同:把「人 + AI 助手的真实协作过程」变成诊断输入。转录里藏着全部真相——哪些技能被反复用到、哪些技能让 Agent 走弯路、哪些问题靠堆 Token 硬解。

Step 3:体检报告看什么——三项打分

3 效率、代码质量、技能覆盖率
/skill-doctor 的三项核心指标:
1. 运行效率(Efficiency)
   · 一次任务多少轮对话/多少 Token 完成
   · 反复试错、来回改说明效率低
2. 代码质量(Quality)
   · 产出代码是否一次到位
   · 测试、边界处理、风格是否稳定
3. 技能覆盖率(Skill Coverage)
   · 现有技能被实际调用的比例
   · 闲置技能 = 白付的 Token

报告形态:
· 每项打分 + 具体证据(引用转录片段)
· 给出「该加 / 该改 / 该删」的技能清单

覆盖率低 ≠ 技能没用:有些技能只在特定任务触发(比如「部署」技能一周用两次),要结合任务分布判断,别一刀切删光——参考《技能资产化》里「按调用频次 × 价值」的筛选法。

Step 4:上手实操——跑一次技能体检

4 三步跑通:收集 → 诊断 → 合并补丁
1. 收集转录
   · Claude Code 用户:确保会话记录已启用
   · 建议攒 1-2 周真实工作量的转录再诊断,
     样本太短结论不可靠

2. 运行诊断(Warp 内执行)
   /skill-doctor
   · 自动扫描可用转录并打分
   · 输出报告 + 技能补丁建议

3. 合并补丁
   · 报告会给出可合并的 skill 补丁(新增/修改/删除)
   · 逐个 review 后合并(别全盘接受)
   · 合并后跑一轮回归,对比成本变化

预期效果(Warp 口径):
· 单次运行成本降约 30%
· 技能库更精简、命中率更高
🚀 建议把「技能体检」做成月度例行:技能库像代码库一样需要维护。结合《Claude Record a Skill》录屏蒸馏和《Agent Skills 开放标准》,就能形成「生产技能 → 体检 → 优化」的完整循环。

Step 5:报告怎么用——分清「补丁」和「建议」

5 自动补丁能合,但要有判断力
补丁类型风险建议
删除闲置技能低(先确认确实没在用)可以合,删除前看一眼调用记录
修改低效技能中(可能影响现有任务)合后跑回归,对比改动前后
新增缺失技能中高(新代码进技能库)先小范围试,验证再推广

自动化生成的补丁是「强烈建议」不是「最终答案」。关键原则:任何技能改动都要能回滚、可对比——这正是《GitHub Teams → Copilot Agent 会话》里「团队级 AI 协作要留痕」的延伸。

Step 6:落地清单——把技能体检固化成习惯

6 个人与团队的体检节奏
个人用法:
· 每月跑一次 /skill-doctor
· 合并补丁前逐条 review
· 记录「体检前后成本对比」验证效果

团队用法:
· 每季度做一次全员技能体检
· 共享最佳技能(跨成员复用)
· 把闲置技能清理列入例行维护

持续观察:
· 体检前:技能 40 个,平均调用率低
· 体检后:技能 25 个,命中率提升
· 成本变化:单次运行成本下降约 30%(自报口径)
→ 用数据验证,别靠感觉

一句话总结:技能库是 Agent 的「肌肉」,
定期体检才不会长成虚胖。
🎉 工具会迭代、数字会变,但「用真实行为数据驱动技能优化」这件事不会过时——/skill-doctor 只是把这件事自动化了。先跑一次体检,你就知道自己该不该用它。
← 返回教程中心