🧠 基础概念

Knowledge Distillation(知识蒸馏)

别名:知识蒸馏模型蒸馏蒸馏Teacher-Student模型压缩
分类🧠 基础概念
阅读时间⏱️ 15 分钟
更新时间📅 2026-07-02
条目编号ENC-CONCEPT-13-distillation
知识蒸馏是一种将大型「教师模型」的知识迁移到更小「学生模型」的技术。在 Agent 场景中,蒸馏使小型模型获得接近大型模型的推理能力,同时大幅降低推理成本和延迟。

关键要点 ✦

详细解释

知识蒸馏(Knowledge Distillation)是一种模型压缩技术:用一个大型高性能的「教师模型」来训练一个更小的「学生模型」。学生模型学习模仿教师模型的输出分布,从而获得接近教师模型的能力,但体积小得多、推理快得多。

形象地说,教师模型把"答题思路"教给了学生模型——学生不需要阅读全部教科书,而是学习教师在每个问题上如何思考和作答。

在 Agent 中的应用

2026 年 Agent 厂商普遍采用「大模型做规划,小模型做执行」的分层架构:

规划层:使用 GPT-o3 或 Claude 4 等大型推理模型,负责任务拆解和复杂规划。

执行层:使用蒸馏后的小型模型(如 7B-14B),负责具体的代码生成和工具调用。

这种架构比纯用大模型便宜 5-10 倍,同时保持 90%+ 的任务完成质量。

争议与监管

2026 年 6 月,「Qwen 蒸馏事件」引发行业震动:Qwen 模型被指控在未经授权的情况下从闭源模型(如 GPT-4)蒸馏知识。这暴露了蒸馏在法律和伦理层面的灰色地带——模型输出的学习是否构成版权侵权?2026 年各国监管机构正在制定蒸馏相关的法规。

🎯 应用场景

Agent 执行层
使用蒸馏后的小模型处理高频工具调用,降低每次调用的成本。
边缘部署
通过蒸馏将 Agent 模型压缩到可在手机/嵌入式设备上运行。
代码补全
IDE 中的代码补全使用蒸馏模型提供实时建议,延迟控制在 100ms 内。

✅ 最佳实践

  • 蒸馏前先明确目标:是减少体积还是提升特定任务性能
  • 平衡蒸馏程度:过度蒸馏会导致学生模型失去通用能力
  • 蒸馏后的模型必须经过安全对齐测试,防止继承偏见
  • 在法律合规方面,确认教师模型的使用条款是否允许蒸馏

🔮 未来展望

蒸馏正在从模型层扩展到行为层。2026 年出现了一种新范式——「行为蒸馏」:不蒸馏模型的参数,而是将教师 Agent 的决策轨迹记录下来,让学生 Agent 学习这些轨迹。这种方法更高效,且法律风险更小。

📖 相关条目

🛠️ 相关产品

🏷️ 标签蒸馏模型压缩知识蒸馏小型模型成本优化