所在组:模型生命周期(桥接) | 上一组出口:理解推理基础与接口契约 | 本页出口:知道何时该动权重而不是改 Prompt 或上检索
RLHF(桥接)
桥接页:本页只回答「RLHF 如何影响你的应用工程决策」。奖励建模、PPO/DPO 的训练机制推导在 Learn LLM(RLHF/DPO 对应章节)。
解决什么问题
基于人类反馈的强化学习(Reinforcement Learning from Human Feedback, RLHF):让人类对模型的多个输出排序,训练一个奖励模型来预测这些偏好,再用强化学习优化模型去最大化奖励分。它改变的不是模型「知道什么」(那是 SFT 和预训练的事),而是模型「怎么表现」——有用、诚实、无害的对齐行为主要来自这一步。
三步流程:
- SFT:在人类演示上训练出基础能力。
- 奖励建模:人类排序 → 训练奖励模型预测偏好。
- 强化学习:优化模型输出以最大化奖励(PPO,或 Direct Preference Optimization 等 Direct 对齐变体)。
为什么应用工程师只理解、不实施
RLHF 需要:大规模人类反馈数据、专职研究团队、可观的训练算力。这是模型厂商(OpenAI、Anthropic、Google、Meta 等)在生产你通过 API 消费的模型时所做的工作。你的工程决策里不会出现「自己跑 RLHF」这个选项——如果你的需求是改行为,先检查主线工具箱:
理解 RLHF 能解释的模型行为
这是本页对你的真实价值——三个常见的「模型为什么这样」:
- 过度拒绝:对齐训练会让模型把边界放大,拒绝一些良性请求。产品侧应对:允许用户澄清重试,而不是接受拒绝为终态。
- 冗长与对冲:模型爱说「作为一门 AI 语言模型…」、答案先铺垫一大段。产品侧应对:prompt 里约束输出形态,配合结构化输出。
- 模型「个性」:不同厂商模型的风格差异主要来自对齐阶段的偏好数据选择。选型时把「个性是否匹配产品语气」当评估项,见评估(桥接)。
决策影响表
| 维度 | 说明 |
|---|---|
| 数据量要求 | 大规模人类偏好排序数据(厂商级投入,应用团队不具备) |
| 成本结构 | 研究级:反馈采集 + 多轮训练 + 评估(本仓不引用具体数字) |
| 生效延迟 | 模型版本级——你只能通过换模型/换版本「使用」新的对齐结果 |
| 维护负担 | 厂商承担;你的维护点是模型版本升级后的行为回归测试 |
SFT 与 RLHF 的分工
把两页桥接放进同一张表,避免「都是训练」的混淆:
| 问题 | 归属 | 改变的东西 | 你的参与方式 |
|---|---|---|---|
| 模型不会我的领域/格式 | SFT | 知识与技能(权重) | 有数据与预算时可立项 |
| 模型的行为方式不对(语气、拒绝、冗长) | RLHF / 对齐 | 行为偏好(权重) | 不立项——通过选型与 prompt 适配 |
| 模型缺实时/私有事实 | RAG | 上下文(权重不变) | 主线日常工作 |
几乎所有旗舰聊天模型都经过 RLHF 或同类对齐(RLAIF / Constitutional AI 等);差别主要体现为各厂商模型的「个性」与安全边界,这是选型评估的一部分。
深层推导与实现
- 奖励模型、PPO、DPO 的推导与对比 → Learn LLM 的 RLHF/DPO 章节。
- 延伸阅读(原始论文):InstructGPT、Constitutional AI、Deep RL from Human Preferences。