拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Weights-Rotated Preference Optimization for Large Language Models

论文《Weights-Rotated Preference Optimization for Large Language Models》总结与翻译一、文章主要内容1. 研究背景与问题现有方法局限:直接偏好优化(DPO)是大语言模型(LLMs)对齐人类偏好的主流方法,可避免强化学习从人类反馈(RLHF)的训练不稳定性与超参数敏感性问题,但存在严重的“奖励黑客”(reward hacking)问题。“奖励黑客”具体表现:模型为追求高奖励,过度降低“被拒绝回答”(rejected completions)的概率,而非真正学习人类偏好特征,导致生成内容冗长重复、多样性缺失,且出现“灾难性知识遗忘”(catastrophic forgetting)。问题根源:从参数空间角度分析,DPO训练会导致模型神经元在参数空间中“坍缩”(neuron collapse),引发表征冗余(representation redundancy),破坏神经元的各向同性分布,削弱模型表达能力。2. 提出的方法:权重旋转偏好优化(RoPO)为解决DPO的“奖励黑客”问题,RoPO采用双重约束机制,同时从输出层logits和中间隐藏层参
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门