Skip to content

所在组:模型生命周期(桥接) | 上一组出口:理解推理基础与接口契约 | 本页出口:知道何时该动权重而不是改 Prompt 或上检索

RLHF(桥接) ​

桥接页:本页只回答「RLHF 如何影响你的应用工程决策」。奖励建模、PPO/DPO 的训练机制推导在 Learn LLM(RLHF/DPO 对应章节)。

解决什么问题 ​

基于人类反馈的强化学习(Reinforcement Learning from Human Feedback, RLHF):让人类对模型的多个输出排序,训练一个奖励模型来预测这些偏好,再用强化学习优化模型去最大化奖励分。它改变的不是模型「知道什么」(那是 SFT 和预训练的事),而是模型「怎么表现」——有用、诚实、无害的对齐行为主要来自这一步。

三步流程:

  1. SFT:在人类演示上训练出基础能力。
  2. 奖励建模:人类排序 → 训练奖励模型预测偏好。
  3. 强化学习:优化模型输出以最大化奖励(PPO,或 Direct Preference Optimization 等 Direct 对齐变体)。

为什么应用工程师只理解、不实施 ​

RLHF 需要:大规模人类反馈数据、专职研究团队、可观的训练算力。这是模型厂商(OpenAI、Anthropic、Google、Meta 等)在生产你通过 API 消费的模型时所做的工作。你的工程决策里不会出现「自己跑 RLHF」这个选项——如果你的需求是改行为,先检查主线工具箱:

  • 想要固定语气/格式 → 提示词工程 + few-shot 示例。
  • 想要领域知识 → RAG。
  • 想要拒绝某类请求 → 输入校验 + 输出过滤(应用安全,见 安全)。

理解 RLHF 能解释的模型行为 ​

这是本页对你的真实价值——三个常见的「模型为什么这样」:

  1. 过度拒绝:对齐训练会让模型把边界放大,拒绝一些良性请求。产品侧应对:允许用户澄清重试,而不是接受拒绝为终态。
  2. 冗长与对冲:模型爱说「作为一门 AI 语言模型…」、答案先铺垫一大段。产品侧应对:prompt 里约束输出形态,配合结构化输出。
  3. 模型「个性」:不同厂商模型的风格差异主要来自对齐阶段的偏好数据选择。选型时把「个性是否匹配产品语气」当评估项,见评估(桥接)。

决策影响表 ​

维度说明
数据量要求大规模人类偏好排序数据(厂商级投入,应用团队不具备)
成本结构研究级:反馈采集 + 多轮训练 + 评估(本仓不引用具体数字)
生效延迟模型版本级——你只能通过换模型/换版本「使用」新的对齐结果
维护负担厂商承担;你的维护点是模型版本升级后的行为回归测试

SFT 与 RLHF 的分工 ​

把两页桥接放进同一张表,避免「都是训练」的混淆:

问题归属改变的东西你的参与方式
模型不会我的领域/格式SFT知识与技能(权重)有数据与预算时可立项
模型的行为方式不对(语气、拒绝、冗长)RLHF / 对齐行为偏好(权重)不立项——通过选型与 prompt 适配
模型缺实时/私有事实RAG上下文(权重不变)主线日常工作

几乎所有旗舰聊天模型都经过 RLHF 或同类对齐(RLAIF / Constitutional AI 等);差别主要体现为各厂商模型的「个性」与安全边界,这是选型评估的一部分。

深层推导与实现 ​

为前端工程师打造 · 基于 VitePress 构建