拓冰建站拓冰建站
首页 / 资讯中心 / 正文

模型基强化学习(MBRL)入门:4 个核心问题,带你完整看懂世界模型与数据高效决策

模型基强化学习MBRL入门4 个核心问题带你完整看懂世界模型与数据高效决策【免费下载链接】awesome-model-based-RLA curated list of awesome model based RL resources (continually updated)项目地址: https://gitcode.com/gh_mirrors/aw/awesome-model-based-RL模型基强化学习MBRL让智能体在脑中先搭一个「世界模型」、在想象里把决策推演完再落地大幅省掉数据高效强化学习里那笔昂贵的真实交互开销。 概念模型无关为什么贵世界模型又在想象什么想象你在教机器人走路或者调一套量化交易策略。每走错一步、每次实盘试错都要花真金白银、真实时间甚至承担安全风险。模型无关强化学习model-free不依赖环境模型的做法很直接反复试错让奖励信号一点点「喂」出策略。问题在于它把绝大多数算力花在了「撞墙」上。任务越复杂、状态空间越大它要付出的交互次数往往是以十万、百万计的。对机器人、自动驾驶、医疗这类「一次试错成本极高」的场景这条路走得太贵。MBRL 换了个思路先花一部分预算从已有交互里学一个环境动态模型——也就是你脑子里那个「如果现在这么做接下来会怎样」的模拟器。学完之后智能体就能在想象空间里快速推演成百上千条未来轨迹挑出最优的那条再执行。这就像下棋前的推演你不必真的走完一整盘只需在脑中模拟几步就能判断哪个开局更稳。这里要分清一件事世界模型想象的并不是要渲染出一段逼真的视频而是要足够准地预测「下一个状态」和「对应的回报」好让决策有据可依。沿着这条主线学界基本把 MBRL 拆成两支。一支关心怎么把模型建好Learn the Model另一支关心模型建好后怎么用它Given the Model。项目里那张分类图把两支的关系画得很清楚世界模型的两条主线建模型世界模型、I2A、MBVE 等与用模型AlphaZero、POPLIN 等。完整清单见 分类框架与论文列表。下面我们不按年份讲而是顺着「每个问题被谁解决」逐个拆开看。 MBRL 论文解读按能力回答 4 个核心问题如何让你的智能体「先想后做」DynaSutton1991是第一个把「学习」和「规划」拧进同一个循环的框架。它为什么重要在那之前强化学习只会埋头试错Dyna 第一次证明你完全可以拿已学到的模型去「伪造」额外经验反过来加速策略更新——想象这件事从此有了正式身份。一个具体细节Dyna 由三部分组成——直接从真实经验学、学一个转移模型、再用这个模型批量生成模拟经验去更新价值表。你每和真实环境交互一步就相当于白赚了一批「免费」的练习数据。如何用概率模型把交互压到几十次PILCODeisenroth 与 RasmussenICML 2011第一次用概率模型来描述环境动态并天然带出了不确定性。它为什么重要单一模型只会给你一个「最可能」的预测却不敢说错在哪高斯过程Gaussian Process一种能同时给出预测值和置信度的概率工具则会在没把握的地方主动「保守」避免拿错误的想象去冒险。一个具体细节在 Cart-Pole小车-悬杆平衡这类任务上PILCO 只需几十次真实交互就能学出可用策略——而模型无关方法当时通常要跑成千上万次。深度学习如何把「想象」做得更猛到了 2017–2018研究者们把「想象模块」正式装进了深度网络。I2AWeber 等2017让智能体用循环神经网络RNN擅长处理时间序列的记忆型网络向未来展开若干步轨迹把这些「想象出来的未来」和真实观察一起喂给策略网络让决策时既看现在、也看预演。World ModelsHa 与 SchmidhuberNIPS 2018则把「脑内模拟器」拆成三块VAE变分自编码器负责把高维观察压成紧凑表示、LSTM负责在表示空间里预测动态、进化策略负责调优策略。它为什么关键第一次证明策略可以完全在压缩后的潜空间里「做梦」式地进化而不必每次都碰像素。一个具体细节这套架构在 CarRacing赛车这类纯视觉任务上达到了接近人类的表现验证了「表示 动态 策略」这条想象路线是走得通的。少样本与鲁棒规划怎么落地单靠一个模型做想象很容易在没见过的状态上「自信地犯错」。现代方法的核心动作就是给想象加保险。PETSChua 等NIPS 2018用一个概率模型集成ensemble多听几位「专家」的意见来刻画不确定性再用交叉熵方法CEM一种在候选动作序列里择优的搜索算法在想象中挑选最优动作序列。在仅 50 次交互的少样本设定下它压过了当时的模型无关方法。MBVEFeinberg 等2018走另一条路把模型预测的多步回报直接加进 Q 值估计让价值函数「看到更远的未来」从而用更少的真实交互拿到更高的回报。ME-TRPOKurutach 等ICLR 2018则把模型集成与信任区域策略优化TRPO限制每步更新幅度以防跑偏结合用集成捕捉的不确定性去约束策略更新让 MuJoCo 连续控制上的数据效率更稳。MBPOJanner 等NeurIPS 2019回答了一个更实际的问题该信模型到什么程度它用 k 分支 rollout 在「想象收益」与「想象风险」之间取平衡再用模型无关方式收尾避免智能体一头扎进模型不靠谱的区域。 MBRL 方法对照表按能力维度选而不是按时间选方法承担的核心能力关键机制典型场景 / 规模Dyna规划与学习融合学转移模型造模拟经验更新策略玩具 MDPPILCO不确定性估计、数据高效高斯过程动态模型Cart-Pole几十次交互GPS轨迹优化 → 策略蒸馏局部轨迹优化 全局神经网络MuJoCo 连续控制I2ARNN 想象增强RNN 展开未来轨迹增强策略AtariWorld Models潜空间想象VAE 表示 LSTM 动态 进化策略CarRacingPETS少样本鲁棒规划概率集成 交叉熵方法50 次交互MBVE价值扩展多步回报并入 Q 值AtariME-TRPO鲁棒策略更新模型集成 信任区域MuJoCoMBPO模型信任边界k 分支 rollout 模型无关收尾MuJoCoDreamer潜想象到控制RSSM 世界模型潜空间训练DMC / AtariMuZero价值等价搜索学习型模型 MCTS围棋 / 国际象棋 / Atari 选型与实践建议什么场景该用哪一类 MBRL 方法选方法前先问自己三个问题真实交互贵不贵环境是像素还是向量你能不能接受部署时还跑规划真实交互极贵机器人、交易、医疗优先 PILCO 式的概率模型或 PETS、ME-TRPO 这类模型集成方法把不确定性和鲁棒性放在第一位。大规模视觉任务、要极致省样本看 World Models、Dreamer 这条潜空间想象线以及 MBVE 这种「模型给模型无关兜底」的混合方案。游戏类、可自对弈、允许搜索AlphaZero、MuZero 这类「学习型模型 蒙特卡洛树搜索」的组合在围棋、国际象棋、Atari 上被验证过。想要「模型 模型无关」各取所长MBVE、I2A、MBPO 都很合适——用模型加速用模型无关兜底。连续控制、要稳定ME-TRPO、MBPO、PETS 提供了不确定性约束下的稳态更新。一个务实的起点是先跑一个模型无关基线再叠一个模型模块观察样本效率曲线在哪里拐头再决定要不要上集成或潜空间想象。 核心挑战与未来方向模型误差累积想象步数一多预测漂移会放大长时程规划最容易翻车。计算开销高质量模型 在线规划本身很吃算力部署时能否承受是关键。何时信任模型智能体在没见过的状态上往往「过度自信」不确定性刻画与信任边界仍是难点。泛化与适应环境一变模型和策略都要能跟上在线模型适应与跨任务迁移是热点方向。 入门资源MBRL 论文、代码与教程清单论文清单项目 README 里的Classic Model-Based RL Papers一节从 Dyna 一路列到 Dreamer 与 MuZero是 MBRL 论文解读最顺手的索引。代码库Meta 的mbrl-lib含 PETS 等经典实现、OpenDILab 的DI-engine决策智能引擎支持多种 MBRL 算法。教程伯克利的博客Model-Based Reinforcement Learning: Theory and Practice即 MBPO 团队的入门解读。获取仓库git clone https://gitcode.com/gh_mirrors/aw/awesome-model-based-RL从 Dyna 读起顺着「它解决了哪一个具体问题」往下你会很快看清所谓「靠想象做决策」不过是一代代研究者把「建模型」和「用模型」这两件事做得越来越省、越来越稳。想动手验证就从 PETS 或 MBPO 的代码开始跑一条轨迹。【免费下载链接】awesome-model-based-RLA curated list of awesome model based RL resources (continually updated)项目地址: https://gitcode.com/gh_mirrors/aw/awesome-model-based-RL创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门