我的歌单

RLHF 是什么:让大模型更像一个可靠助手

发表于
更新于
字数: 1.1k
时长: 8m
阅读: -
玉门

RLHF 先解决的不是“会不会”,而是“像不像助手”

很多人第一次听到 RLHF,会以为它是一种让 AI 变聪明的神秘训练法。更准确地说,RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)主要解决的是:一个已经会续写文本的大语言模型,怎样更好地听懂人的意图、遵守指令、拒绝明显危险的请求,并用更符合人类偏好的方式回答。

预训练阶段的大模型像一个读过海量文本的“续写器”。你输入一句话,它会预测后面最可能出现什么。这个能力很强,但它天然不等于“愿意帮你完成任务”。如果你问它“帮我总结这段邮件”,原始模型可能继续模仿论坛讨论、百科条目,甚至编出一个看似合理的故事。ChatGPT 之所以比早期 GPT-3 更像助手,很大程度上来自指令微调和对齐训练。

OpenAI 在 InstructGPT 中系统展示了这条路线:让模型从“预测互联网文本”进一步变成“按照用户指令给出有帮助、诚实、无害的回答”。这也是理解 ChatGPT 的关键背景。

为什么 ChatGPT 需要对齐

“对齐”不是让模型拥有人的价值观,也不是给模型安装一个道德开关。它更像产品化前的行为校准:用户希望模型回答问题,而不是只续写问题;希望它承认不知道,而不是硬编;希望它面对危险请求时拒绝或转向安全解释;希望它语气清楚、结构稳定、少绕圈子。

没有对齐的大模型并非完全不可用,但会很难预测。它可能在一个问题里给出精彩解释,在下一个问题里突然进入角色扮演;可能为了满足“看起来像答案”的统计目标,编造不存在的论文、命令或法律条文。对齐训练试图把这些行为往“人类更愿意接受”的方向推。

不过要注意:对齐是一组工程方法,不是一次性解决所有问题的魔法。它会改变模型输出偏好,却不能保证模型事实永远正确。

直观流程:SFT、奖励模型与 PPO

RLHF 常见流程可以拆成三步。

第一步是 SFT(Supervised Fine-Tuning,监督微调)。人工标注者或专家给出一批高质量问答示例,比如用户问“解释一下光合作用”,示例回答会写得清楚、准确、有层次。模型用这些样本继续训练,学会“指令进来,答案出去”的基本格式。可以把 SFT 理解成请老师先示范一遍。

第二步是训练 Reward Model(奖励模型)。这一步不要求标注者直接写标准答案,而是让他们比较多个候选回答:A 和 B 哪个更好?好在哪里?系统收集大量偏好排序后,训练一个模型去预测“人类更喜欢哪个回答”。奖励模型不是真理裁判,它只是把人类偏好压缩成一个可计算的分数。

第三步常用 PPO(Proximal Policy Optimization)这样的强化学习算法优化聊天模型。模型生成回答,奖励模型打分,PPO 根据分数调整模型参数,让它更倾向于输出高分回答。同时还会加入约束,避免模型为了追求奖励分数而偏离原本语言能力太远。这个过程像是:老师先示范,评委再学会打分,学生最后反复练习并根据评分调整表达。

实际系统会更复杂:数据要去重和质检,安全策略要单独设计,奖励模型要防止被“投机取巧”的回答欺骗,训练后还要经过红队测试与线上反馈。

RLHF 不等于消除幻觉

RLHF 可以减少一部分胡说八道,尤其是让模型更愿意承认不确定、请求澄清或拒绝无依据断言。但它不能从根上消灭幻觉。

原因很简单:大语言模型生成文本时,核心机制仍然是根据上下文预测下一个 token。它没有内置一个永远最新、永远可核验的事实数据库。奖励模型也只是从历史偏好中学习“什么回答看起来更好”,并不能验证每一句话是否真实。如果训练数据里某类错误答案经常显得自信、完整、格式漂亮,模型仍可能学到这种坏习惯。

所以在需要事实可靠的场景里,RLHF 往往要和检索、工具调用、引用来源、权限控制、人工复核一起使用。比如另一篇关于 RAG 的文章 会讲到,模型可以先查外部知识库,再基于检索结果回答。这能改善知识新鲜度和可追溯性,但也有自己的失败模式。

后 RLHF:DPO、RLAIF 与可验证奖励

RLHF 不是唯一的对齐方法。DPO(Direct Preference Optimization)尝试直接用偏好数据优化模型,绕开单独训练奖励模型再跑 PPO 的复杂流程。它通常更简单、稳定、工程成本更低,因此在很多开源模型微调中很常见。

RLAIF(Reinforcement Learning from AI Feedback)则把部分人类反馈替换成 AI 反馈。比如让一个更强的模型评价回答质量,或先由 AI 生成偏好标签,再由人类抽检。这可以扩大数据规模、降低成本,但风险是把评审模型的偏见和盲点继续放大。

还有一条重要路线是“可验证奖励”。对于数学、代码、格式转换、工具执行等任务,答案不是只能靠人类主观偏好评价,而是可以运行测试、检查证明、验证约束。代码能不能通过单元测试,SQL 能不能返回正确结果,工具调用是否真的完成任务,这些都可以形成更硬的奖励信号。相比“看起来不错”,可验证奖励更接近“确实做对了”。

普通读者应该怎样理解 RLHF

可以把 RLHF 看成大模型从“会说话”走向“会当助手”的关键训练工序。它让模型更顺从指令、更符合人类沟通习惯,也让 ChatGPT 这类产品从研究演示变成日常工具。

但它的边界同样重要:RLHF 改善的是行为偏好,不是事实本身;它能降低风险,却不能保证答案必然正确;它让模型更会拒绝和解释,却不等于模型真正理解了所有社会语境。未来的可靠 AI 系统,很可能不是只靠一种对齐算法,而是把 RLHF、DPO、RLAIF、检索、工具调用、可验证奖励和人工监督组合起来。

理解这一点,就不会把 RLHF 神化,也不会低估它。它不是终点,但确实是现代大模型变得好用的一座桥。

延伸阅读