笔记十二:大语言模型强化学习(RL for LLMs)笔记

发布时间:2026/7/23 16:48:52
笔记十二:大语言模型强化学习(RL for LLMs)笔记 本文档整理了关于“大语言模型中的强化学习”的核心概念与知识框架适合从零开始学习的小白也适合复习回顾。内容涵盖为什么需要RL、RL如何应用于文本生成、两种主流范式RLHF与RLVR、核心算法PPO/DPO/GRPO以及后续学习路线图。一、引言为什么大语言模型需要强化学习1.1 传统方法的局限SFT的“天花板”在强化学习出现之前训练大语言模型的主要方法是监督微调Supervised Fine-TuningSFT。SFT是怎么做的简单说就是给模型看一大堆“问题-标准答案”对让模型模仿着写。比如给模型看“请写一首关于春天的诗”“春风又绿江南岸…”模型就学着写类似的诗。SFT的问题在哪里SFT的本质是模仿学习——模型最多只能学到训练数据里有的东西永远超不过“老师”人类标注员的水平。就像一个学生只会抄标准答案考试时遇到没见过的题目就傻眼了。用一个比喻来理解SFT阶段模型像一个抄写员——人类怎么写它就怎么学。抄写员写得再好最多和老师一样好永远超不过老师。1.2 RL如何打破这个天花板强化学习Reinforcement LearningRL彻底改变了这个模式。RL是怎么做的模型不再只是“抄答案”而是自己写答案然后系统给它打分。为了拿高分模型会自己琢磨出新招数、新推理步骤——这些新招数是人类没教过它的。用一个比喻来理解RL阶段模型像一个做题家——自己写答案裁判打分。为了拿高分它会自己研究解题技巧甚至发明人类没想到的方法。结果就是RL-trained模型可以突破训练数据的质量上限产生比人类标注员更优的输出。1.3 现实中的例子所有前沿模型都在用RLGPT-4、Claude、Llama-3、DeepSeek-R1——它们都在SFT之后应用了RL这是将“有能力但不可控”的模型转变为“对齐的助手”的关键一步。二、两种主流RL范式强化学习方法分为两大流派目的不同但底层原理相通。范式一对齐人类偏好RLHF / DPO目的让模型听话、安全、有道德——比如不教你造炸弹、不输出有害内容。怎么打分靠人类偏好。让人类投票“A回答比B好”然后训练一个“裁判模型”来打分。代表方法RLHF基于人类反馈的强化学习训练奖励模型→用PPO优化DPO直接偏好优化跳过奖励模型直接把偏好转化为损失函数结果产生“温顺的好助理”。范式二增强推理能力RLVR目的让模型变聪明——主要针对数学、代码、逻辑推理。怎么打分靠客观事实/规则Verifiable Rewards。比如数学题答案对不对答案是“32”就是“32”代码能不能跑通能跑就是能跑不需要人类感觉不需要主观判断代表方法RLVR基于可验证奖励的强化学习DeepSeek-R1就是用这种方法结果模型自己进化出复杂的“思维链”长推理能力数学推理能力大幅提升。一个震撼的例子GPT-4o做AIME数学竞赛题原本只有12%正确率加了RLVR后飙到93.4%。两种范式的对比RLHF/DPORLVR目标让模型听话、安全让模型变聪明、会推理奖励来源人类偏好主观客观验证对/错典型应用聊天助手、内容审核数学推理、代码生成代表模型GPT-4、ClaudeDeepSeek-R1三、核心洞察文本生成 马尔可夫决策过程MDP要让RL算法能处理文字科学家把“写作文”重新定义成了一个闯关游戏——这就是马尔可夫决策过程Markov Decision ProcessMDP。3.1 用游戏来理解把大模型写答案想象成一个游戏游戏概念在LLM中的对应通俗解释智能体Agent大模型本身玩游戏的“玩家”状态State已经写出来的所有文字题目已写内容游戏进行到当前的“局面”动作Action从词表里选下一个词32K~128K个选项玩家下一步“操作”状态转移Transition把选中的词贴在后面完全确定没有随机性不像下棋对手会变招奖励Reward只有整篇写完才给分游戏通关后才算总分策略Policy模型内部的Softmax输出玩家在不同局面下的“操作策略”3.2 最关键的洞察大模型天生的“Softmax输出层”本身就是一个现成的策略网络。什么意思就是说传统RL需要单独搭建一个“策略网络”来决定怎么行动但大语言模型本身就是一个策略网络——它在每个位置都会给所有词打分概率分布所以我们不需要重新搭建策略网络只需要直接调整模型内部的权重让它倾向于把高概率分配给那些能拿高分的“选词顺序”即可3.3 形式化定义数学上文本生成的MDP可以这样定义状态st(x,y1,…,yt−1)s_t (x, y_1, \dots, y_{t-1})st​(x,y1​,…,yt−1​)提示词 已生成的所有token动作at∈{1,…,∣V∣}a_t \in \{1, \dots, |\mathcal{V}|\}at​∈{1,…,∣V∣}从词表中选择下一个token转移P(st1∣st,at)P(s_{t1} | s_t, a_t)P(st1​∣st​,at​)确定性的——直接把选中的token拼上去奖励rrr通常在生成结束时才给出稀疏奖励策略πθ(at∣st)\pi_\theta(a_t | s_t)πθ​(at​∣st​)LLM的next-token概率分布折扣因子γ1.0\gamma 1.0γ1.0因为每个episode只有一次回复不需要折扣四、RLHF的完整流程经典的RLHF流程包含四个阶段阶段1监督微调SFT做什么在高质量的人类标注数据上训练基座模型产出一个能听懂指令、能正常对话的模型πSFT\pi_{\text{SFT}}πSFT​类比让模型先学会“像人一样说话”阶段2训练奖励模型Reward Model做什么收集大量人类偏好对比数据对于同一个问题回答A比回答B好用 Bradley-Terry 目标训练一个奖励模型Rϕ(x,y)R_\phi(x, y)Rϕ​(x,y)产出一个能对任意回答打分的“裁判模型”类比找一个“评分老师”能判断哪个回答更好阶段3强化学习优化做什么用奖励模型作为信号通过 PPO 或 GRPO 优化策略同时加一个 KL 约束防止模型跑偏类比模型疯狂写作文裁判打分不断调整写作策略KL约束是什么相当于一个“刹车皮”——防止模型为了拿高分不择手段比如编造歪理邪说强制它不能偏离原始模型太远阶段4评估与迭代做什么评估对齐后的模型收集新的失败案例再来一轮类比月考→改错→再月考五、LLM中的RL vs 经典RL有什么不同LLM里的强化学习跟传统游戏AI比如AlphaGo下围棋有4个关键区别区别1环境没有随机性确定性转移经典RL环境可能有随机性比如骰子、对手的随机策略LLM RL选“好”字下个状态就是“加上好字”完全确定区别2奖励极其稀疏Sparse Reward经典RL每一步都可能拿到奖励比如游戏里每吃一个金币都有分LLM RL写几百个字中间没人打分只有最后一句“对了/错了”区别3动作空间巨大Massive Action Space经典RL动作空间通常很小比如上下左右四个方向LLM RL每一步要在几万个词里选一个32K~128K个选项区别4带着“脚镣”跳舞KL约束经典RL追求最大化奖励可以随便探索LLM RL必须紧贴SFT时的原始模型防止为了拿高分而胡言乱语代价是探索能力变弱区别5有时不需要“价值网络”经典RLPPO需要一个“评论家”Critic网络来估算胜率GRPO直接把这部分省了用组内相对排名代替六、核心算法一览6.1 PPO近端策略优化——GPT-4和Claude背后的主力全称Proximal Policy Optimization通俗理解PPO的本质是一种“保守的强化学习算法”。核心思路是“在安全范围内调整模型的输出策略”避免策略突变导致模型失效。用一个比喻来理解PPO像一所拥有“三堂会审”制度的精英学院——有演员Actor即模型本身、评论家Critic评估表现、裁判Reward Model打分。三者配合精准但昂贵。组成Actor演员当前正在训练的模型负责生成回答Critic评论家一个价值网络负责估算“这个回答能得多少分”Reward Model裁判从人类偏好训练出来的打分模型优点稳定、精准、效果好缺点需要同时跑4个模型Actor、Reference、Critic、Reward Model显存占用极大训练复杂适用场景追求极致效果、不差钱不差算力的场景如GPT-4、Claude6.2 DPO直接偏好优化——绕过RL的捷径全称Direct Preference Optimization通俗理解DPO从理论上彻底消除了奖励模型RM和强化学习环节直接把“人类喜欢A不喜欢B”这个偏好转化为一个对比学习的损失函数用监督学习的方式训练模型。用一个比喻来理解DPO像一本高质量的“改错本”——直接记录“好回答 vs 差回答”的对比模型从中学习不需要额外的裁判和复杂的RL流程。优点不需要训练奖励模型不需要在线采样计算量小、稳定、高效缺点对数据质量要求极高灵活性不如在线RL因为不能实时探索新策略适用场景数据质量高、算力有限、快速验证的场景6.3 GRPO组相对策略优化——DeepSeek-R1的成名绝技全称Group Relative Policy Optimization通俗理解GRPO是DeepSeek团队的创新算法。它完全去掉了Critic评论家网络改用“组内相对比较”的方式来评估表现。用一个比喻来理解GRPO像一种“小组竞赛制”——让模型对同一个问题生成多個回答放在一组里互相比较排名高的得高分排名低的得低分。不需要额外的“评论家”来评分。具体怎么做的对同一个问题让模型生成一组回答比如8个用奖励函数给每个回答打分在组内做归一化减去均值除以标准差用归一化后的相对优势来更新模型优点不需要训练价值网络Critic省显存、省计算训练更稳定特别适合推理任务数学、代码缺点组内比较的有效性取决于组内样本的质量分布适用场景推理模型训练的首选DeepSeek-Math和DeepSeek-R1都是用它三个算法的对比总结PPODPOGRPO需要奖励模型✅ 需要❌ 不需要✅ 需要但可简化需要Critic网络✅ 需要❌ 不需要❌ 不需要训练复杂度最高最低中等显存占用最高最低中等效果上限最高中等高代表模型GPT-4、Claude各种开源模型DeepSeek-R1七、后续学习路线图各章 preview第5章PPO —— 近端策略优化讲什么裁剪目标函数、GAE广义优势估计、Critic网络、完整的RLHF训练循环为什么学PPO是GPT-4和Claude背后的主力算法是理解前沿模型训练的基础理论怎么做通过“裁剪”机制限制每次更新的幅度防止策略突变用GAE平衡偏差与方差来估计“优势”解决什么问题传统策略梯度算法更新步长难控制步长太小学得慢步太大容易崩第6章DPO —— 直接偏好优化讲什么如何把偏好直接转化为对比监督损失完全绕过RL为什么学比PPO简单得多适合快速上手和资源受限场景理论怎么做从Bradley-Terry偏好模型出发推导出可直接优化的损失函数解决什么问题RLHF流程太复杂4个模型、在线采样DPO让偏好对齐变得像SFT一样简单第7章GRPO —— 组相对策略优化讲什么DeepSeek的无Critic算法组级奖励归一化为什么学DeepSeek-R1背后的方法目前训练推理模型的首选理论怎么做对同一问题采样一组回答组内归一化奖励用相对优势更新策略解决什么问题PPO的Critic网络耗显存、难训练GRPO直接砍掉它第8章偏好优化变体讲什么在线DPO、KTO、Best-of-N采样以及如何选择方法为什么学实际项目中需要根据场景选算法没有万能方案理论怎么做每种方法有不同的“探索-利用”权衡和数据效率解决什么问题不同任务、不同数据量、不同算力下该用哪种方法第9章奖励建模讲什么Bradley-Terry模型、过程奖励vs结果奖励、RLVR的规则奖励、多目标组合为什么学奖励函数的设计直接决定了RL的效果上限理论怎么做如何从人类偏好数据学习奖励函数如何设计可验证的规则奖励解决什么问题奖励信号是RL的“指挥棒”设计不好模型会“奖励黑客”钻空子第10章SFT最佳实践讲什么序列打包、对话模板、数据混合为什么学SFT的质量直接决定了RL的天花板理论怎么做数据预处理、格式标准化、采样策略解决什么问题RL之前的基础打不好RL也救不回来第11章系统工程讲什么分布式训练、并行策略、生成-训练解耦、数百张GPU的基础设施为什么学真正的LLM训练不是单卡能搞定的理论怎么做模型并行、数据并行、流水线并行如何让生成和训练异步进行解决什么问题算法再好工程跑不起来也是白搭八、总结一句话串起来SFT教会模型“像人一样说话” →RLHF/DPO教会模型“不说坏话” →RLVR如DeepSeek-R1教会模型“解出难题”。虽然“不说坏话”和“解出难题”看着不像一回事但它们底层都是用“奖励 梯度更新”这一套数学公式来驱动模型进化的。所有的前沿模型——GPT-4、Claude、Llama-3、DeepSeek-R1——都在SFT之后应用了RL这是将“有能力但不可控”的模型转变为“真正可用”的助手的关键一步。