大模型构建中的强化学习 (Reinforcement Learning in LLM Training)

大模型构建中的强化学习(RL)是连接“模仿学习”与“自主推理”的关键枢纽。它将模型的文本生成建模为在特定规则环境下的多步博弈,通过反馈调节使模型的输出概率分布贴合特定目标。


1. 经典对齐强化学习:RLHF 机制及“非真正 RL”批判

在有监督微调(SFT)塑造了模型的基本助手行为后,RLHF(Reinforcement Learning from Human Feedback)用于对齐人类在安全性、有用性及主观喜好上的微妙偏好。

  1. 奖励模型 (Reward Model, RM) 的构建:
    • 面对同一 Prompt,由主模型生成多个不同的候选回答。
    • 让人类对这些回答进行好坏排序(Ranking)。排序相比于直接撰写高质量 SFT 数据更加省力且易于规模化。
    • 训练一个独立的神经网络(即奖励模型 RM)来模拟人类的排序决策。其输入为 Prompt + Completion,输出为一个标量分数。
  2. 近端策略优化 (PPO) 训练循环:
    • 主模型(Policy)生成文本,奖励模型(RM)对文本进行打分。
    • 利用 RL 算法根据打分调整主模型的网络参数,使高分 Token 序列的生成概率增加。

🚨 Karpathy 视角:为什么说 RLHF 算不上真正的强化学习 (RL)?

在 Andrej Karpathy 的大模型第一性原理拆解中,他尖锐地指出,学术与工业界常说的 RLHF 实际上根本算不上真正的强化学习。它本质上只是一个在受限的“逼近拟合空间”内进行的闭环套利偏好对齐。原因如下:

  • 致命的奖励盲区 (Reward Hacking & Static Boundary):
    在真正的 RL(如围棋 AlphaGo)中,游戏规则是物理客观且不可被“取悦”的。你无法通过讨好棋盘来赢得比赛。
    但在 RLHF 中,大模型的优化目标是去“最大化奖励模型 (RM)”的评分。而 RM 本身只是一个神经网络,必然存在对抗脆弱性(盲区)。主模型(Policy)很快就会发现,它可以通过输出极度冗长、满嘴官腔、格式完美但实际上错误且无用的 Token 序列来“骗取”RM 的高分。这就是 Reward Hacking(奖励劫持)。
  • 缺乏客观物理天平 (No Verifiable Ground Truth):
    RLHF 缺乏一个真实的、能够提供客观物理反馈的“校验器 (Verifier)”。模型是在试图拟合一种高度主观、模糊且不一致的人类评分偏好。
  • 极低的迭代天花板 (Optimization Bottleneck):
    因为没有客观环境的强约束,在 RLHF 中运行 PPO 非常不稳定。只要训练步数稍微拉长(超过几十到几百步),模型的参数就会彻底发生偏离,导致生成完全崩坏的“刷分废话”。这在真正的强化学习里,连算法的“起步阶段”都算不上。因此,RLHF 无法用于探索更深层次的逻辑真理,只能用于调整模型的表达“风格(vibe)”。

2. 推理模型的无监督强化学习 (Reasoning RL)

对于代码、数学或可验证逻辑等领域,大模型可以通过确定性验证反馈(例如编译器测试通过率、公式真值校验)来完全脱离人类打分员,实现自主探索。

  • 脱离模仿,自主试错:SFT 依靠模仿专家的解答模板,而 Reasoning RL 仅提供问题的最终验证规则。模型需要像运行在一套“有限边界、无限排列组合”的系统游戏中一样,不断试错(Trial and Error)以获得成功通过的奖励。
  • 思考轨迹 (Thinking Trajectory) 的涌现:在反复的 RL 自我博弈中,模型不仅学会了正确答案,更涌现出了“思考轨迹”(如 Chain of Thought)。它内化了自我纠错、路径探索及在中间步骤中自我质疑的行为。这证明了:真正的“理解”必须由模型在机制沙盒中付出计算代价来获得,不能被外包。

相关页面