拓冰建站拓冰建站
首页 / 资讯中心 / 正文

信息论低效并非瓶颈:RL训练大模型为何依然有效

先看一个现象。2024 年底到 2025 年DeepSeek-R1、Kimi k1.5、OpenAI o1 系列把大模型的能力天花板又拉高了一档公开技术报告里都明确写着核心不是继续堆 SFT 数据而是大规模强化学习RL。另一边信息论分析给出了一个听起来很矛盾的结论RL 训练 LLM 在信息层面非常低效每个 token 能传递的关于“如何改进策略”的信息量极其有限和预训练阶段每个 token 贡献的交叉熵信息相比差了至少一个数量级。这个矛盾如果成立那我们怎么解释 R1 这类模型的推理能力提升这篇文章就把这个问题拆开回答三个问题信息论低效到底指什么为什么实践中 RL 还能用以及这套分析对训练框架、奖励设计和精度选择有什么实际指导。先给一个总判断信息论低效是真实存在的理论约束但它并没有成为实践瓶颈。原因是 RL 阶段需要传递的信息量本来就很小同时实际训练过程在无意识中绕开了“平均每 token 分配信息”的假设。下面逐条拆解。1. 核心问题速览在进入细节之前先把“信息论低效”和“实践有效”这两条线放在一起对比方便后面阅读时随时回看。维度结论信息论低效的论点在线 RL 中策略更新被 KL 预算约束每个 token 能传递的信息量通常远小于预训练阶段实践中的事实大规模 RL 显著提升数学推理、代码生成、Agent 任务能力成为 post-training 关键环节缓解机制 1预训练先验使 RL 只需要重定位行为分布不需要重学知识所需信息量天然很小缓解机制 2简单梯度下降具有低熵压缩特性实际梯度集中在少数关键 token有效信息密度被提高缓解机制 3测试时计算、验证器、过程奖励把稀疏的成功信号逐步放大工程含义可验证奖励、冷启动、KL 预算监控、训练精度设置比很多人想象的更重要这个表格里的“缓解机制”也是后面第 3 节展开讨论的主线。只要其中任何一条成立信息论分析给出的“每 token 信息量低”就不再是决定性瓶颈。2. 信息论低效到底在说什么2.1 RL 在 LLM 上为什么能成功先看现象。SFT 本质是模仿学习给定输入输出对模型学习“下一个 token 是什么”。它只能让模型复现训练数据里的行为模式没办法直接优化“这个回答最终是否被验证为正确”。RL 不一样。它把目标从“模仿”换成“最大化奖励”模型可以在训练时自行探索多条路径再根据验证结果强化高分路径、抑制低分路径。在数学、代码这类任务里正确答案可以被程序化验证奖励信号非常明确RL 就能不断把输出分布推向更可能正确的方向。这种“探索 验证 择优”的循环是静态数据拟合做不到的。它相当于让模型在训练阶段就跑了很多条推理路径然后用外部验证器告诉它哪条路能走通。所以 post-training 阶段越来越像搜索加策略优化而不是简单的模仿学习。2.2 信息论分析的核心论点信息论视角对此提出了质疑。在线 RL 更新策略时新旧策略之间通常要控制 KL 散度防止模型分布瞬间崩掉。PPO、GRPO 等算法里的 KL 惩罚项本质就是把策略变化量限制在很小的范围内。KL 散度的单位是 nats1 nat 约等于 1.44 bits也就是1 / ln(2)bits。如果一次更新的 KL 预算只有 0.01 到 0.1 这个数量级那么平均到每个 token 上能传递的信息就非常有限。对比之下预训练阶段模型在预测下一个 token 时每个 token 的标签都提供了明确的监督信息交叉熵损失通常以 nats 为单位计算而且数值比 RL 的 KL 预算大得多。两相比较RL 的每 token 信息量确实低了一到两个数量级。这也是“信息论低效”这个名字的由来。2.3 一个关键前提低效不等于无效这里有一个容易混淆的地方。信息论分析隐含的假设是模型需要从一个信号中真正学到新概念、新事实。如果目标真的如此那么每 token 信息量低就是致命伤。但 RL 阶段的目标不是学新知识而是重新排序已有的行为模式。可以把预训练加 SFT 后的模型理解成一个“已经会很多动作”的个体RL 要做的不是教会它这些动作而是告诉它“在什么情况下优先用哪个动作”。重排行为所需的分布变化量远比学习新知识小。这个前提差异是理解整个问题的第一把钥匙。3. 为什么实践中 RL 仍然有效五个关键机制3.1 预训练先验RL 只是重定位不是重学习一个训练充分的 LLM在进入 RL 阶段之前已经拥有完成任务的基本骨架语言能力、世界知识、指令跟随、甚至一部分弱推理能力。数学推理并不是 RL 从零“发明”的而是以低概率形式存在于预训练分布里比如模型可能只在 20% 的情况下输出正确步骤。RL 的工作是把这个概率从 20% 推到 60% 或者 80%。从信息论角度看这种概率重分配并不需要巨大的分布变化。模型在最开始就已经把“正确推理链”放在低概率位置RL 只需要把相关 token 的概率质量提高一点把高概率的错误路径压下去。这个调整过程中需要传递的信息量恰好落在 KL 预算范围内。反过来如果要求模型学会一个完全没见过的新领域并且只给它 RL 奖励信号信息瓶颈就会真正卡住训练。这也是纯 RL 冷启动经常失败的原因DeepSeek-R1 这类工作早期同样依赖少量冷启动 SFT 数据本质就是先用监督数据把基本动作做对再让 RL 做行为校准。3.2 简单梯度下降是“低熵压缩器”信息论分析通常假设信号被最优地编码和利用但实际训练用的是简单梯度下降。这两者之间有一个非常关键的差异简单梯度下降在低熵 token 上的梯度更稳定在高熵 token 上的梯度噪声更大。具体来说当模型在某个 token 位置的概率分布接近均匀分布时采样结果的随机性很高不同样本算出来的梯度方向差异也很大更新容易被噪声淹没。当模型在某个 token 位置的概率分布接近 one-hot 时采样结果基本确定梯度方向稳定更新可以持续有效地改变这一个位置的分布。于是简单梯度下降会优先压缩低熵 token 对应的概率质量高熵 token 的移动则非常缓慢。结果就是策略的实际变化没有“平均摊”到所有 token 上而是集中在少数低熵、可预测的位置。那些真正携带学习信号的位置获得的有效信息密度远高于理论平均值。这一点与一些关于 on-policy distillation 的研究观察一致简单梯度下降更像是一种低熵策略压缩过程而不是严格的最大似然或信息最优更新。3.3 梯度不均匀性关键 token 才是主力在长回答中绝大多数 token 是“陪跑”真正因为奖励而改变概率的只有少数关键 token。举一个数学推理链的例子用户让模型计算23 * 47 15模型先输出第一步23 * 47 1081再输出1081 15 1096最后输出答案。如果第一步算成1071后续步骤全部跟着错整条序列 100 个 token 里真正需要修正的其实只有“1081”这个 token 附近的分布。从梯度计算角度看奖励信号会通过整条序列反向传播但归因到每个 token 的梯度幅度差异非常大。失败链条中的第一个错误 token 往往获得最大梯度其余正确 token 的梯度很小。RL 实际上是在做错误定位和路径强化而不是均匀地对每个 token 注入信息。这也是过程奖励模型PRM有效的原因之一过程奖励把“哪一个步骤错了”这个定位信息显式给出来模型不再需要通过整条序列去间接推断错误位置梯度可以直接落在关键步骤上。3.4 测试时计算放大了 RL 信号训练阶段每个 token 携带的信息量少不代表系统整体收益小。推理阶段可以用大量计算去弥补训练信号的稀疏性。o1 和 R1 的长思维链本质上就是 test-time compute scaling同一道题模型生成多条候选推理链再通过验证器选择最终答案。即使 RL 只把“输出正确推理倾向”的概率提升了很小一点在多次采样和验证器的配合下最终答案的正确率也可能大幅提升。可以把训练阶段理解成给策略注入一个微弱但正确的偏置推理阶段再做多次筛选放大这个偏置。单独看 RL 的训练信号确实信息量有限但加上推理时的搜索、多数投票、best-of-N整个系统的有效收益远大于训练信号本身的信息量。这也解释了为什么现代推理模型的训练和推理往往是联合设计的训练时强化“可验证的推理倾向”推理时用更多计算换取稳定性。3.5 过程奖励和监督信号把稀疏信息变密集结果奖励只在序列最后给出一个标量对错两种结果信息量接近 1 bit。这个过程里中间几百个 token 只能通过整条序列的反向传播间接获得信号。过程奖励的做法是把奖励拆到每个推理步骤模型每完成一个步骤验证器立即判断这一步是否正确。代码执行反馈、工具调用返回结果、Agent 环境观测本质上都是过程奖励的变体。过程奖励带来的信息增益非常直接。它把一个整体的标量信号拆成 N 个步骤级信号每个步骤都能更精确地影响对应位置的 token 分布。而且环境反馈并不一定通过 KL 预算通道回传而是作为下一轮生成的观测直接进入上下文模型可以直接根据反馈调整下一步动作。这等于绕开了“每 token 最多传递 KL 散度那么多信息”的限制。可验证奖励在 2025 年特别受重视原因就在这里它把模糊的、全局的、低信息量的奖励转换成了清晰的、局部的、高信息量的反馈。4. 信息论视角下的 RL 训练框架设计4.1 RL 冷启动与可验证奖励理解信息瓶颈之后再看现在主流训练框架的设计意图就清晰很多。冷启动的做法是在 RL 之前用少量高质量 SFT 数据让模型“先会做基本动作”RL 阶段只负责“把正确动作选出来”。这和前面讲的预训练先验是同一条逻辑先让模型拥有完成任务的骨架再用 RL 做行为重排而不是让 RL 承担过多信息传输任务。可验证奖励的作用同样在这里。数学题的答案可以比对标准答案代码可以真实执行看是否通过测试Agent 任务可以检查工具调用返回结果是否符合预期。只要奖励可验证反馈信号的信息质量就远高于人类偏好打分这种模糊反馈。DeepSeek-R1 和 Kimi k1.5 的成功经验里都有这一条优先选择可验证任务用规则或代码执行器做验证器减少对奖励模型泛化能力的依赖。4.2 KL 预算、熵正则与奖励归一化从信息论角度理解 KL 预算可以解释很多工程经验。KL 系数太大策略更新每一步被限制得过死奖励信号传不进去训练几乎不动KL 系数太小策略可能一步跨出安全区域生成分布迅速坍缩或暴涨。正确的做法通常是小步更新同时监控 KL 曲线和策略熵。GRPO 这类 group-based 算法的另一个关键点是 reward 归一化。同一 prompt 采样多个回答计算每个回答的 reward再在组内做 z-score 归一化。这样模型学到的不是绝对 reward 值而是相对比较“这个回答比组内其他回答好多少”。在信息有限的情况下这种相对比较信号比绝对数值更稳定。下面给一个简化版 GRPO 风格训练循环用于说明信号分配逻辑# 简化版 GRPO 风格训练循环仅用于说明信号分配逻辑 def grpo_step(policy, ref_model, tokenizer, prompts, verify_fn, kl_coef0.1): group_size 16 all_outputs, all_logprobs, all_ref_logprobs, all_rewards [], [], [], [] for prompt in prompts: outputs policy.generate( tokenizer(prompt, return_tensorspt)[input_ids], num_return_sequencesgroup_size, max_new_tokens1024, ) logprobs policy.logprobs(outputs) ref_logprobs ref_model.logprobs(outputs) rewards [verify_fn(tokenizer.decode(o)) for o in outputs] all_outputs.extend(outputs) all_logprobs.extend(logprobs) all_ref_logprobs.extend(ref_logprobs) all_rewards.extend(rewards) # 组内 z-score 归一化同一 prompt 的多个回答相互比较 rewards group_normalize(all_rewards) # KL 惩罚当前策略相对参考策略的分布差异单位 nats kl torch.stack(all_logprobs).mean() - torch.stack(all_ref_logprobs).mean() advantages rewards # 用优势加权策略梯度再加上 KL 惩罚 loss -(advantages * torch.stack(all_logprobs)).mean() kl_coef * kl optimizer.zero_grad() loss.backward() optimizer.step()这个伪代码省略了 generate 内部实现、tokenizer padding、mask 处理等细节重点在于“采样组内比较 KL 惩罚 稀疏优势”这一套信号处理流程。实际项目中可以直接套用 TRL、OpenRLHF、veRL 等框架的实现。4.3 精度问题与 RL 梯度稀疏性热词里经常出现的 FP16、BF16、FP32 精度问题在 RL 阶段比 SFT 阶段更敏感。原因和梯度稀疏性直接相关RL 的有效梯度集中在少数关键 token 上这些梯度的绝对值如果被低精度表示中的噪声覆盖学习信号就可能直接被丢掉。FP16 容易出现溢出因为指数位范围有限BF16 有更大的数值范围但尾数精度低FP32 最稳但显存和计算开销高。RL 训练中比较稳妥的做法是使用混合精度前向传播用 FP16 或 BF16 提速反向传播的关键部分用 FP32 累积梯度裁剪阈值也要比 SFT 阶段更保守。如果训练过程中发现模型在某个关键步骤上始终学不会可以优先检查该位置的梯度在低精度下是否被裁剪或丢失。下面是一个 KL 与熵监控的示例代码import torch torch.no_grad() def monitor_kl_and_entropy(policy, ref_model, input_ids): logits policy(input_ids).logits probs torch.softmax(logits, dim-1) # 策略熵单位 nats越小表示模型越确定
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门