拓冰建站拓冰建站
首页 / 资讯中心 / 正文

【AI黑话日日新】Day 044|GRPO(分组相对策略优化)

一句话说清:让模型自己跟自己比,哪条回答更得分就多学哪条。1. 它到底在说什么GRPO 是英文 Group Relative Policy Optimization 的缩写,中文译作“分组相对策略优化”。它是一种用来微调大语言模型的强化学习算法,核心思路可以概括成一句话:对同一个问题,让模型一口气生成好几条回答,再拿它们的得分互相比较,得分高于“小组平均分”的就多学一点,低于平均的就少学一点。用一个生活化的类比来理解:传统做法像请一位私教(评论家)盯着你每一次练习,给你逐拍打分;GRPO 则像把一个学习小组放在一起——不请私教,而是让这一组人互相比。某人这次做得比同组平均水平好,就被认为“方向对”,下次更可能这么做;比平均差,就被认为“方向偏”,下次压下去。谁好谁坏,由组内相对位置决定,不需要额外请一位裁判。2. 为什么现在这个词很热GRPO 的走红有一条清晰的时间线。2017 年,OpenAI 的 John Schulman 等人提出 PPO(Proximal Policy Optimization,近端策略优化,arXiv:1707.06347),成为后来 RLHF(Reinforcement Learning from Human Feedb
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门