拓冰建站拓冰建站
首页 / 资讯中心 / 正文

基于MAPPO的NR-V2X感知-通信-计算一体化跨层资源分配实践

1. 项目概述当车联网需要“一心三用”最近和几个在车厂做智能驾驶的朋友聊天他们都在头疼同一个问题下一代的车尤其是那些号称要“全场景智能”的车型身上的“包袱”越来越重。这包袱不是别的正是车上那堆传感器、通信模块和计算单元。雷达要感知环境5G NR-V2X要和周围的车、路、云实时“对话”车载电脑还得在毫秒间处理海量数据做出决策。这听起来很美好但资源就那么多——频谱、算力、功耗都是硬约束。于是一个经典的“既要、又要、还要”的难题就摆在了面前感知、通信、计算这三件事如何在资源有限的车载系统里和谐共处甚至互相成就这正是“Integrated Sensing, Communication, and Computing for NR-V2X”面向NR-V2X的感知-通信-计算一体化简称ISCC这个研究方向要啃的硬骨头。它不是一个简单的功能叠加而是要求系统能像一个老练的司机眼睛感知看着路况嘴巴通信和同伴交流信息大脑计算同时规划路线三者协同效率最大化。传统的做法往往是分层设计感知层干感知的活通信层只管传数据计算层埋头苦算层与层之间像隔着一堵墙信息不通资源分配僵化很容易造成“感知到了危险但数据传不出去”或者“算力都用来处理无关紧要的图像导致关键的控制指令延迟”这种尴尬局面。所以我们需要的是一套“Cross-Layer Resource Allocation”跨层资源分配框架能打通这三层的壁垒根据实时任务需求动态、智能地调配频谱、时间、功率和计算资源。而实现这种动态智能调配目前最被看好的工具就是“Multi-Agent Reinforcement Learning”多智能体强化学习MARL。你可以把每一辆车甚至车上的每一个功能模块如感知子系统、通信链路调度器看作一个独立的智能体Agent。它们共同处在一个复杂、动态的车联网环境中每个智能体的行动比如我这辆车是选择用更多功率发射雷达波进行精细感知还是把功率省下来保障通信的可靠性都会影响其他智能体和整个环境的态势。MARL就是让这群智能体通过不断试错和学习找到一套协作策略使得全局的长期收益比如整体交通效率、安全性最优。我这次要分享的就是基于这个思路构建一个面向NR-V2X的ISCC跨层资源分配框架的完整实践。我们会用到MAPPOMulti-Agent Proximal Policy Optimization这类先进的MARL算法作为核心引擎。这不仅仅是一个理论推演我会带你从问题定义、系统建模一直走到算法实现、仿真验证和结果分析把其中关键的参数设计、踩过的坑以及调优心得毫无保留地摊开来讲。无论你是通信背景想了解AI如何赋能还是AI背景想寻找落地场景抑或是车联网领域的工程师相信都能从中找到可以直接参考的“干货”。2. 核心问题拆解为什么ISCC需要跨层与多智能体在深入技术细节之前我们必须先搞清楚为什么在NR-V2X场景下感知、通信、计算的一体化和跨层资源分配如此迫切又为什么非得用多智能体强化学习来解决。2.1 NR-V2X场景下的资源冲突与协同机遇NR-V2X也就是基于5G新空口的车联网通信它带来的不仅是更快的速率更是更低的时延和更高的可靠性。这为实现高级别的协同自动驾驶如编队行驶、交叉路口协同通行提供了可能。然而这也意味着资源竞争空前激烈。首先看资源冲突频谱资源冲突车载雷达如毫米波雷达和5G通信尤其是高频段可能工作在相近的频段。如果各自为政雷达信号会对通信造成干扰反之亦然。这就是典型的“感知 vs 通信”冲突。时间/时隙资源冲突在基于时隙的NR-V2X通信中如Mode 2车辆需要竞争资源来发送数据。同时感知任务如周期性扫描也有自己的时序要求。如何安排感知窗口和通信时隙避免相互抢占是个难题。计算资源冲突车载计算单元如域控制器的CPU/GPU资源是有限的。同时感知数据点云、图像的处理、通信协议栈的运行、决策规划算法的执行都在争夺算力。一个复杂的感知算法可能吃掉大量算力导致关键的车辆控制指令计算延迟。能量资源冲突高功率的雷达发射和高速率的数据通信都非常耗电。在电动汽车上功耗直接关系到续航里程。再看协同机遇通信辅助感知车辆间可以通过V2X通信共享彼此的感知结果如目标列表、可通行区域实现超视距感知弥补单车传感器的盲区。这要求通信链路能可靠、低时延地传递这些感知信息。感知辅助通信感知获得的环境信息如周围车辆的精确位置、速度可以用来优化通信。例如预测其他车辆的移动轨迹从而更精准地选择通信波束指向或者预判信道质量变化提前切换资源块提升通信效率。计算任务协同一些计算任务可以卸载。比如一辆算力不足的车可以将部分感知数据处理任务通过可靠的V2X链路卸载到邻近算力富余的车或路侧单元RSU上进行协同计算。所以ISCC的核心思想就是不再把感知、通信、计算视为三个独立的“烟囱”而是看作一个整体系统的三种“能力”。我们的目标是在资源总量的硬约束下动态协调这三种能力的“出力”比例以最优的方式支持上层应用如自动驾驶、交通效率提升。这本质上是一个高维、动态、多目标的优化问题。2.2 为什么传统优化方法“力不从心”面对这样的问题我们首先会想到用传统的凸优化、动态规划等方法。但它们在这里面临巨大挑战环境高度动态且不确定车辆高速移动周围环境车辆数、位置、障碍物瞬息万变信道条件剧烈波动。很难用一个精确的数学模型来刻画所有动态因素。问题规模庞大资源维度多频、时、空、功率、算力车辆数量多联合优化的决策空间是指数级增长的属于NP-hard问题传统方法在实时性上无法满足。缺乏全局信息在分布式V2X网络中每辆车通常只有局部观测信息自己的传感器数据、有限的V2X消息无法获得全局的、完美的环境状态。传统集中式优化需要全局信息不适用。2.3 多智能体强化学习的破局之道多智能体强化学习MARL恰好能应对上述挑战。处理不确定性MARL通过与环境的交互试错来学习不依赖于精确的环境模型。它学习的是在不确定环境下做出良好决策的策略。分布式决策每个智能体车基于自身的局部观测做出决策无需一个全知全能的中心节点。这符合V2X网络分布式的本质。学习协作策略通过设计合适的奖励函数Reward Function可以引导智能体们学习到协作行为。例如奖励函数可以同时考虑单车感知精度、通信成功率、任务处理时延以及全局的交通流平滑度。适应动态性策略网络具备一定的泛化能力能够适应未曾见过的动态场景。而MAPPOMulti-Agent PPO是MARL中一个非常流行的算法。它继承了PPOProximal Policy Optimization训练稳定、采样效率相对较高的优点并通过集中式训练、分布式执行CTDE的框架来解决多智能体信用分配Credit Assignment的难题。简单说在训练时我们允许一个“中央评论家”Critic看到所有智能体的信息或全局状态来更好地评估联合行动的价值但在执行时每个智能体只用自己的“演员”Actor网络根据局部观测独立行动。这既保证了训练的有效性又满足了执行的分布式要求。注意选择MAPPO而非其他MARL算法如MADDPG、QMIX一个重要考量是其在连续或高维离散动作空间中的稳定性和表现。车辆资源分配问题中功率、时隙比例等通常是连续值MAPPO处理起来更自然。3. 系统建模与框架设计理论说清楚了我们开始动手搭建框架。第一步是把现实问题“翻译”成MARL能理解的语言即进行系统建模。3.1 智能体、状态、动作与奖励函数定义这是强化学习最核心的四个要素定义的好坏直接决定了算法能否学到有效的策略。1. 智能体Agent定义在我们的框架中每一辆参与协同的智能网联车辆IV被定义为一个智能体。路侧单元RSU可以作为具有特殊能力的智能体或环境的一部分。假设场景中有N辆车。2. 状态空间State Space设计每个智能体i在时刻t的局部观测状态 s_i^t 需要包含足够的信息以做出资源分配决策。一个典型的设计包括自身状态车辆位置、速度、航向角当前电池电量/功耗预算计算单元CPU/GPU的实时负载率。感知任务需求当前激活的感知任务类型如前方障碍物检测、盲区监测及其QoS要求如更新频率、检测精度阈值。通信任务需求待发送消息的队列状态如安全消息、感知共享消息、计算卸载请求以及各自的优先级、大小、截止时间Deadline。局部环境信息通过自身传感器感知到的邻近车辆/障碍物的相对位置和速度通过上一周期V2X消息获取的有限邻车意图信息如转向灯状态。无线信道信息估计的到邻近车辆或RSU的信道状态信息CSI或信道质量指示CQI。历史动作信息上一时刻采取的动作资源分配方案用于让策略网络感知决策的连续性。3. 动作空间Action Space设计智能体i在每个决策周期输出的动作 a_i^t即其资源分配方案。这是一个混合动作空间可能包括感知资源分配分配给雷达感知的发射功率比例连续值0~1感知波束的扫描模式或重点区域选择离散值。通信资源分配选择通信的发射功率连续值在NR-V2X的感知-预留Sensing-Based Semi-Persistent Scheduling, SB-SPS机制中选择要预留的资源块Resource Block, RB和预留周期离散选择。计算资源分配分配给不同任务感知处理、通信协议栈、应用计算的CPU核心数或计算时间片比例连续值是否将某个计算任务卸载至邻车或RSU二值决策。实操心得动作空间的设计需要平衡表达能力和学习难度。将所有资源维度联合输出为一个高维向量虽然灵活但学习难度大。实践中我们常将其分解为几个子策略网络Sub-policy分别输出感知、通信、计算相关的动作或者采用分层动作结构。初期建议从简化的动作空间开始验证。4. 奖励函数Reward Function设计奖励函数是引导智能体学习的“指挥棒”设计最为关键。我们的奖励需要融合ISCC的多重目标感知质量奖励 R_sense与感知任务的完成质量正相关。例如目标检测的准确率Precision和召回率Recall加权和减去感知的功耗成本。R_sense w1 * (α*Precision β*Recall) - w2 * P_sense通信质量奖励 R_comm与通信任务的完成情况正相关。例如成功在截止时间前送达的高优先级消息数量减去通信的功耗成本并惩罚传输失败或冲突。R_comm w3 * (Num_successful_high_priority_msgs) - w4 * P_comm - w5 * Num_collisions计算效率奖励 R_comp与计算任务的及时完成度和系统负载均衡度相关。例如惩罚任务处理超时奖励平均任务处理延迟的降低鼓励成功的计算卸载。R_comp -w6 * Avg_task_delay - w7 * Num_overdue_tasks w8 * Num_successful_offloading全局协作奖励 R_global为了促进协作可以加入全局性奖励。例如奖励整体交通流平均速度的提升惩罚车辆间安全距离的违规。R_global w9 * Avg_traffic_speed - w10 * Num_safety_violations单个智能体的即时奖励通常是上述各项的加权和r_i^t R_sense R_comm R_comp R_global权重系数w1, w2, ...需要仔细调校以平衡不同目标的优先级。此外为了鼓励长期性能我们采用带折扣因子的累计奖励Return作为优化目标。3.2 跨层资源分配框架架构我们的框架采用经典的CTDE架构具体模块如下[智能体1] [智能体2] ... [智能体N] | | | 分布式执行仅Actor v v v [局部观测s1] [局部观测s2] ... [局部观测sN] | | | v v v [Actor网络 π1] [Actor网络 π2] ... [Actor网络 πN] 参数可共享 | | | v v v [动作a1] [动作a2] ... [动作aN] | | | v v v | | | | v v | [环境交互] —— 产生新的状态和全局奖励 | | v v [经验回放缓冲区] (存储轨迹: s, a, r, s) | v (集中式训练时使用) [全局状态信息] (可选) | v [集中式Critic网络 V(s) 或 Q(s, a)] | v [策略梯度更新] (PPO更新规则更新所有Actor和Critic)工作流程初始化为每个智能体创建相同的Actor网络π和一个集中式的Critic网络V。初始化经验回放缓冲区。交互与收集每个智能体根据当前局部观测s_i通过其Actor网络加入探索噪声采样得到动作a_i即资源分配方案。所有智能体执行动作与环境车联网仿真平台交互得到新的局部观测s_i‘和全局奖励r由各车奖励求和或单独计算。将轨迹 (s, a, r, s) 存入缓冲区。集中式训练从缓冲区采样一批轨迹。Critic网络利用全局状态或所有智能体的观测和动作拼接来估计状态值函数V(s)或动作值函数Q(s, a)。然后使用PPO的损失函数来更新Actor网络参数其目标是最大化“优势函数”实际回报与Critic估计值之差同时限制每次策略更新的幅度确保训练稳定。Critic网络通过最小化价值估计的误差来更新。分布式执行训练完成后部署时只需每个智能体的Actor网络。每个车基于自身实时局部观测通过Actor网络前向传播即可得到资源分配动作实现自主、分布式的决策。4. 基于MAPPO的算法实现与核心参数有了框架接下来就是具体的算法实现。我们选择MAPPO下面给出其核心实现步骤和关键参数考量。4.1 MAPPO算法流程详解MAPPO的核心是每个智能体都有一个策略网络Actor和一个共享的价值网络Critic。其更新遵循PPO的裁剪Clipping机制。算法伪代码简述初始化所有智能体的Actor参数θ和共享Critic的参数φ。forepisode 1 to Mdo:清空临时轨迹缓冲区。fort 1 to T (或直到回合结束)do:每个智能体i根据当前策略π_θ(a_i | s_i)采样动作a_i^t加入探索。所有智能体执行联合动作a^t环境返回新状态s^{t1}和奖励r^t。存储 (s^t, a^t, r^t, s^{t1}) 到临时缓冲区。end for计算临时缓冲区中每个时间步的优势函数估计A^t通常用GAE方法。将临时缓冲区中的数据并入全局经验回放缓冲区。fork 1 to K (更新轮数)do:从全局缓冲区采样一小批mini-batch数据。更新Critic最小化价值损失 L_V(φ) E[(V_φ(s) - R)^2]其中R是实际回报。更新Actor最大化PPO裁剪目标函数L_CLIP(θ) E[ min( ratio * A, clip(ratio, 1-ε, 1ε) * A ) ]其中ratio π_θ(a|s) / π_θ_old(a|s)ε是裁剪超参数如0.2A是优势函数。更新网络参数θ和φ。end forend for4.2 神经网络结构与关键参数调优1. 网络结构设计Actor网络输入层维度状态空间维度→ 全连接层如256 unitsReLU→ 全连接层如128 unitsReLU→ 输出层。输出层根据动作空间设计连续动作输出每个连续动作维度的均值μ同时网络还会输出一个独立的状态依赖的对数标准差log_std或固定方差。动作从正态分布N(μ, exp(log_std)^2)中采样。离散动作输出每个离散动作维度的logits通过Softmax得到概率分布。Critic网络输入层维度全局状态或所有智能体观测拼接的维度→ 全连接层如256 unitsReLU→ 全连接层如128 unitsReLU→ 输出层1 unit线性激活输出状态价值V(s)。2. 关键超参数与调优经验折扣因子 γ通常在0.95-0.99之间。越接近1智能体越考虑长期回报。在车联网这种需要长远规划的场景建议从0.98开始尝试。GAE参数 λ用于平衡优势估计的偏差和方差常用0.95-0.98。PPO裁剪范围 ε控制策略更新幅度的关键通常设为0.1-0.3。较小的ε如0.1更新更保守稳定但可能学习慢较大的ε如0.3学习快但可能不稳定。我们从0.2开始。学习率Actor和Critic的学习率需要精细调节。通常Critic的学习率可以略高于Actor例如Actor: 3e-4, Critic: 5e-4。使用学习率衰减策略如线性衰减有助于后期收敛。批次大小Batch Size与更新轮数K每次从缓冲区采样多大的数据批次进行更新以及用这批数据更新多少次K。较大的批次和适中的K如batch_size1024, K5-10有助于稳定训练。奖励缩放Reward Scaling不同奖励项的量级可能差异巨大如感知准确率在0~1通信消息数量可能几十。直接相加会导致某项奖励主导。务必对奖励进行标准化或缩放这是一个至关重要的技巧。可以运行一个随机策略一段时间计算各奖励项的均值和标准差然后进行标准化。踩坑实录在早期实验中我们没有对奖励进行缩放导致“通信消息成功数”这项奖励数值在0-50完全主导了学习过程智能体疯狂优化通信而完全忽略了感知和计算。对奖励进行归一化减去均值除以标准差后学习过程立刻变得平衡且有效。5. 仿真环境搭建与实验设计理论算法需要在实际场景中验证。我们选择在仿真环境中进行因为它安全、可控、可重复。5.1 仿真平台选择与场景构建我们采用SUMOSimulation of Urban MObility进行交通流仿真生成车辆移动轨迹。同时使用OMNeT/INET或Python自定义仿真器来模拟NR-V2X通信协议栈特别是PC5接口的Mode 2资源选择机制和无线信道。感知和计算过程的模拟则通过简化的模型在Python中实现。典型测试场景城市十字路口多方向车流存在视线遮挡对协同感知和低时延通信要求高。高速公路合流区车辆高速行驶需要频繁的协同感知和决策来安全汇入。密集城区道路车辆密度高通信干扰严重资源竞争激烈。在仿真中我们需要实时获取每辆车的状态SUMO提供模拟其感知过程如基于距离和遮挡的简单检测模型模拟通信过程包括信道竞争、数据包传输、冲突、时延并模拟计算任务的处理队列和延迟。5.2 基准对比方案设计为了评估我们提出的MARL框架的性能必须设计合理的对比基准Baseline固定资源分配Fixed为感知、通信、计算分配固定的资源比例。这是最简单的方案作为性能下限。分层优化Layered Optimization感知、通信、计算各自独立优化无跨层信息交互。例如感知按固定周期工作通信采用标准的NR-V2X Mode 2机制计算采用简单的先到先服务FCFS调度。基于规则的跨层启发式方法Rule-based根据一些预设规则动态调整资源。例如“如果通信队列长度超过阈值则降低感知功率增加通信资源”。单智能体强化学习Single-Agent RL假设存在一个中心控制器收集所有车辆信息进行集中式资源分配。这提供了性能上界在信息完全的情况下但不符合分布式架构且可扩展性差。5.3 核心评估指标我们需要从ISCC的三个维度以及整体系统角度进行评估感知性能平均目标检测精度mAP、感知更新频率、感知覆盖盲区比例。通信性能数据包送达率PDR、端到端时延特别是高优先级安全消息的时延、通信资源利用率、冲突概率。计算性能任务平均处理时延、计算任务卸载成功率、计算单元平均负载率。系统整体性能系统总效用即加权奖励值、车辆平均速度反映交通效率、安全事件如追尾、碰撞风险发生率。资源效率平均功耗感知通信计算、频谱效率单位Hz传输的比特数。通过在不同交通密度、不同任务负载下对比MARL框架与各个基准方案在这些指标上的表现才能全面证明其优越性。6. 结果分析与典型问题排查经过大量仿真实验我们得到了丰富的性能数据。这里分享一些关键发现和调试过程中遇到的典型问题。6.1 性能对比分析我们通常在中等交通密度如每公里20-30辆车的场景下进行主实验。下表展示了一个简化版的性能对比摘要评估指标固定分配分层优化规则启发式单智能体RL我们的MAPPO框架感知mAP0.650.720.780.880.85通信PDR92%95%96%98%97%高优先级消息时延(ms)2520181214计算任务平均时延(ms)5045403035系统总效用基准1.01.21.52.11.9平均功耗(W)10095908085分析MAPPO vs. 传统方法我们的框架在各项指标上均显著优于固定分配和分层优化证明了跨层协同设计的必要性。也优于基于规则的方法显示了学习型策略的优越性和适应性。MAPPO vs. 单智能体RL我们的分布式MAPPO框架性能略低于集中式的单智能体RL这是可以预期的因为分布式智能体只有局部观测。但这个差距并不大系统效用从2.1降到1.9却换来了可扩展性和鲁棒性无单点故障。这是一个非常重要的权衡。资源效率MAPPO框架的功耗低于传统方法但略高于理论最优单智能体RL说明其在提升性能的同时也较好地兼顾了能效。更深入的分析会发现在交通拥堵时MAPPO智能体会倾向于分配更多资源给通信和协同感知以缓解局部拥堵而在车辆稀疏时则会增加单车感知精度和计算资源减少通信开销。这种动态适应性是固定规则难以实现的。6.2 训练过程中的常见问题与调试技巧在训练MAPPO模型时我们遇到了不少挑战以下是排查清单问题现象可能原因排查与解决思路奖励不上升策略不学习1. 奖励函数设计不合理存在稀疏奖励或奖励尺度问题。2. 探索不足智能体陷入局部最优。3. 网络结构或学习率不当。1.检查奖励可视化每个奖励分项看是否有信号。务必进行奖励缩放/归一化。2.增加探索在Actor输出动作时初期增大探索噪声如高斯噪声的标准差。使用课程学习Curriculum Learning从简单场景开始。3.调整网络与学习率尝试更深的网络或调整学习率通常先尝试调小。训练不稳定奖励剧烈震荡1. 批次大小Batch Size太小。2. PPO裁剪参数ε太小更新步伐过大。3. 智能体数量多环境非平稳性Non-stationarity强。1.增大Batch Size。2.调小ε如从0.2调到0.1或调小学习率。3. 这是MARL的固有难题。可以尝试在Critic输入中加入其他智能体的身份编码ID或历史信息帮助其区分不同对手/队友。使用参数共享的Actor网络也有助于稳定。智能体学会“作弊”或出现怪异行为奖励函数存在漏洞被智能体找到了“捷径”。例如为了获得“通信成功”奖励不断发送无用的低优先级小包。仔细审查奖励函数确保其与最终目标一致。加入惩罚项例如惩罚无效通信、惩罚资源浪费。进行消融实验Ablation Study移除或修改某项奖励观察行为变化定位问题根源。Critic损失下降但Actor性能不提升Critic过拟合学到了一个“平庸”的价值函数无法为Actor提供有效的梯度方向。1. 检查Critic网络是否比Actor网络复杂太多如层数多、神经元多适当简化Critic。2. 在Critic的输入中增加正则化如Dropout。3. 使用更先进的优势估计方法如GAE结合价值函数基线Value Function Baseline。分布式执行时性能下降训练和测试环境存在差异Sim-to-Real Gap或者训练时Critic依赖的全局信息在执行时不可用。1. 在训练时可以尝试让Critic仅使用智能体自身的观测和动作来学习或者使用注意力机制如Transformer来筛选重要邻车信息这能提升策略在分布式执行时的鲁棒性。这正是“Actor-Attention-Critic for Multi-Agent Reinforcement Learning”这类方法的动机它让Critic学会关注最重要的信息而不是依赖全盘信息。关于网络热词“Actor-Attention-Critic”的补充这个思路对我们的工作有很好的启发。在我们的框架中可以尝试将Critic网络改造为Attention-Critic。让每个智能体的Critic在估计状态价值时不是简单拼接所有智能体的信息而是通过注意力机制动态地加权聚合其他智能体的观测信息。这样智能体可以学会在决策时“关注”那些对其当前决策最重要的邻居车辆例如正前方同车道车辆比远处侧方车辆更重要从而学习到更高效、更鲁棒的策略并减轻对全局信息的依赖。7. 总结与未来工作展望构建这样一个面向NR-V2X的ISCC跨层资源分配框架是一个典型的“系统级”优化问题它要求我们将通信、感知、计算和人工智能等多个领域的知识进行深度融合。通过这个项目我深刻体会到MARL尤其是MAPPO这类算法为解这类复杂、动态、分布式的资源协同问题提供了一个极具潜力的工具。它不追求一次性的静态最优解而是学习一种能适应环境变化的动态策略。从工程实践的角度最大的挑战往往不在算法本身而在问题建模和奖励函数设计。如何将模糊的“系统性能好”翻译成精确的、可计算的数学表达式并且平衡好不同目标之间的竞争关系需要反复的迭代和大量的仿真实验来验证。另一个痛点是仿真到现实的迁移。仿真中的信道模型、感知模型都是对现实的简化训练出的策略能否在真实车辆上work还需要通过大量的实车测试和在线学习来不断调整。这个框架还有很多可以扩展的方向。例如考虑更复杂的车辆行为模型引入行人和非机动车等交通参与者探索异构网络车-车、车-路、车-云下的多层资源联合分配将框架与具体的自动驾驶决策规划模块进行闭环集成评估其对最终驾驶安全性和舒适性的提升。此外随着大模型和基础模型的发展如何利用预训练的知识来加速MARL在车联网场景下的训练也是一个非常前沿且有趣的话题。最后分享一个在调参中的小技巧可视化是关键。不要只看最终的奖励曲线一定要把智能体在仿真中的行为录屏下来观察它们在不同场景下是如何分配资源的。很多时候从行为反推奖励函数或网络结构的问题比盯着数字曲线要直观得多。这个过程虽然繁琐但能让你对智能体正在学习什么以及为什么这么学有更深刻的理解。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门