🧠 基础概念

RLHF 与后训练对齐(Post-Training Alignment)

别名:人类反馈强化学习对齐RLHFDPO指令微调
分类🧠 基础概念
阅读时间⏱️ 18 分钟
更新时间📅 2026-07-16
条目编号ENC-CONCEPT-24-rlhf
RLHF(基于人类反馈的强化学习)是用人类偏好数据微调模型、使其输出更符合人类期望的技术。它与指令微调(SFT)、直接偏好优化(DPO)共同构成大模型的「后训练对齐」阶段,决定了 Agent 底层模型的可用性与安全性。

关键要点 ✦

后训练的三个阶段

SFT(监督微调):用人工示范让模型学会指令遵循与基本格式。RLHF/DPO(偏好对齐):用「哪个回答更好」的成对偏好数据,把模型推向人类期望的方向。安全对齐:专门抑制有害、违规输出。

Agent 能力的底座即在此时奠定——模型是否「听话、可靠、守规矩」。

RLHF 到 DPO

传统 RLHF 需训练奖励模型再强化学习,流程复杂、不稳定。DPO(Direct Preference Optimization)跳过奖励模型,直接以偏好对优化策略,简单且效果相当,已成为 2025–2026 年主流。

更前沿的还有 RLAIF(用 AI 反馈替代人类反馈)以降低标注成本。

对齐的权衡

对齐是在有用性(Helpful)、无害性(Harmless)、诚实性(Honest)之间取平衡。过度强化无害可能让模型「拒答过多」;过度强调有用又可能放松安全。Agent 场景还额外需要工具使用对齐——让模型在「该调用工具时不犹豫、不该调用时不越权」。

🎯 应用场景

模型供应商
闭源/开源模型通过 RLHF 提升指令遵循与安全性。
领域定制模型
医疗、法律等行业用偏好数据做专项对齐。
Agent 底座选型
考察模型的后训练质量决定 Agent 行为可靠性。

✅ 最佳实践

  • 理解模型对齐边界,避免把未对齐模型直接接入高危工具
  • 对行业场景补充领域偏好数据做二次对齐
  • 持续监控「拒答率」与「越权率」两个对齐指标
  • 把安全护栏与模型对齐视为互补的双层防护

🔮 未来展望

后训练将更自动化:用模型自生成反馈(RLAIF)+ 可验证奖励(如测试通过)替代昂贵人工标注;Agent 专项对齐(工具调用守纪)会成为模型差异化的关键维度。

📖 相关条目

🛠️ 相关产品

🏷️ 标签RLHF对齐后训练DPOSFT偏好优化