🧠 基础概念

Fine-Tuning(微调)

别名:微调模型微调指令微调SFTLoRA
分类🧠 基础概念
阅读时间⏱️ 16 分钟
更新时间📅 2026-07-02
条目编号ENC-CONCEPT-12-fine-tuning
Fine-Tuning 是在预训练模型基础上使用特定数据集进行额外训练的技术。在 Agent 场景中,微调用于定制 Agent 的行为风格、增强特定领域能力或优化工具调用格式。

关键要点 ✦

详细解释

Fine-Tuning(微调)是在已经预训练好的基础模型上,使用更小、更特定领域的数据集进行额外训练,使模型在特定任务上表现更好。

在 AI Agent 场景中,微调的应用场景包括:让 Agent 按特定格式输出工具调用、让 Agent 更好地理解特定行业的术语和流程、优化 Agent 的安全对齐行为、让 Agent 的输出风格符合企业品牌要求。

微调 vs 提示工程

2026 年企业优化 Agent 的标准路径是「提示工程 → RAG → 微调」三阶路径:

步骤 1(最低成本):通过 Prompt Engineering 优化 Agent 行为,成本几乎为零。

步骤 2(中等成本):引入 RAG 连接外部知识库,解决知识不足问题。

步骤 3(最高成本):如果前两者仍不够,进行领域微调。LoRA 微调成本约 $500-2000。

大多数 Agent 场景不需要微调——优质 Prompt + 完善的知识库已经足够。

主流方法

全量微调(Full Fine-Tuning):更新所有模型参数,效果最好但成本极高(百万级)。

LoRA:在模型旁附加小矩阵进行训练,仅更新 0.1-1% 的参数。效果接近全量微调但成本降至十分之一。2026 年最流行的方法。

QLoRA:在 LoRA 基础上引入 4-bit 量化,使微调可在单张消费级 GPU 上运行。

🎯 应用场景

Agent 输出格式化
微调模型使其输出符合特定 JSON 结构,减少工具调用解析错误。
领域术语适应
在医疗、法律等专业领域微调,让 Agent 准确理解行业术语和流程。
行为安全对齐
微调使 Agent 更严格遵循安全规则,降低 Prompt Injection 成功率。

✅ 最佳实践

  • 遵循「先 Prompt,再 RAG,最后微调」的优化路径,避免过度投资
  • 微调数据集至少需要 500-1000 条高质量样本,低质量数据会降低模型能力
  • 微调后务必在通用基准上测试,防止灾难性遗忘
  • 使用 LoRA 而非全量微调,成本低 90% 且效果接近

🔮 未来展望

2026 年 Agent 定制化正在从「模型微调」向「行为配置」转变——通过 MCP Tools、System Prompt 和个性化记忆的配置实现定制,无需触及模型权重。这降低了 Agent 定制的门槛,使非技术人员也能配置专属 Agent。

📖 相关条目

🛠️ 相关产品

🏷️ 标签微调Fine-TuningLoRA模型定制SFT