ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

基于多智能体强化学习的C-V2X无线接入技术动态选择策略

基于多智能体强化学习的C-V2X无线接入技术动态选择策略 1. 从单车智能到协同决策C-V2X场景下的通信选择难题在智能网联汽车这个赛道里待了十几年我亲眼看着技术路线从单车智能的“单打独斗”一步步走向车路协同的“集团作战”。现在大家聊得最多的除了激光雷达和算法就是C-V2X蜂窝车联网了。这玩意儿说白了就是让车、路、人、云之间能实时“对话”。但真到了落地环节一个最实际、也最让人头疼的问题就冒出来了车在路上跑面对LTE-V2X和5G-V2XNR-V2X这两种主流的无线接入技术到底该用哪个什么时候切换这可不是个简单的二选一。想象一个十字路口一辆自动驾驶的网联车正驶向一个复杂的无保护左转场景。它需要和路侧单元RSU交换高精地图数据和对面来车协商路权还要接收来自云端交通管理平台对信号灯配时的动态优化建议。LTE-V2X的直连通信PC5接口时延低、可靠性高适合车与车、车与路这种“近场”的紧急安全消息广播而5G-V2X的网络通信Uu接口带宽大、覆盖广适合下载高清地图、接收云端算力下发的复杂感知结果这种“大块头”数据。车上的通信模块OBU资源有限天线、功率、计算能力都不是无限的不可能同时全功率跑两套通信协议。这就好比一个人不能一边用对讲机和旁边的人喊话一边又用手机开视频会议还得保证两边都不掉链子。所以RAT选择无线接入技术选择就成了一个动态的、必须实时优化的决策问题。传统的规则引擎或者静态门限切换比如“信号强度低于XX dBm就切到5G”在车辆高速移动、业务需求瞬息万变的V2X场景下显得非常笨拙甚至危险。一个错误的切换决策可能导致关键的安全消息如紧急制动预警丢失几百毫秒后果不堪设想。这就是为什么我和团队最近把目光投向了多智能体强化学习。我们想探索的是能否让路上的每一辆车都变成一个具有学习能力的智能体它们不仅能感知自身的状态位置、速度、业务需求还能与其他车辆、基础设施进行有限的协同共同学习出一套最优的通信策略在满足各类V2X业务服务质量的同时最大化整个局部交通区域的通信效率。这听起来很前沿但背后的驱动力非常实际为未来大规模、高密度的网联自动驾驶提供一个更智能、更柔性的通信“大脑”。2. 问题建模把通信选择变成一个多智能体博弈要把MARL用起来第一步也是最关键的一步就是把你面对的实际问题精准地“翻译”成强化学习模型的语言状态、动作、奖励。这个过程如果没想清楚后面算法再高级也是白搭。2.1 智能体、状态空间与动作空间的定义在我们的场景里每一辆装备了C-V2X OBU的网联车自然就是一个独立的智能体。它的目标是为自己的多个并发V2X业务如车辆状态广播、感知共享、远程驾驶选择最合适的RAT。状态空间必须包含所有影响决策的信息。对于车辆i其状态 s_i 至少包括信道状态信息包括对LTE-V2X PC5侧行链路和5G-V2X Uu链路的实时测量如参考信号接收功率、信干噪比、预估的包传输时延和丢包率。车辆运动状态位置、速度、加速度、航向角。这决定了它与其他通信节点车、路侧单元的相对位置和拓扑关系直接影响PC5通信的质量。业务需求画像当前车辆上正在运行或即将触发的V2X应用列表。每个应用都有其关键性能指标需求我们将其量化为一个需求向量。例如高优先级安全类业务如前向碰撞预警需求向量 {时延: 100ms 可靠性: 99.99% 数据包大小: 小}。中吞吐量协同类业务如协同感知需求向量 {时延: 100ms 可靠性: 99% 数据包大小: 中}。高吞吐量信息娱乐类业务如高清地图更新需求向量 {时延: 1000ms 可靠性: 95% 数据包大小: 大}。动作空间相对简单就是一个离散的选择。对于每个智能体车辆在每一个决策时刻它需要为每一个活跃的V2X业务流从动作集合A中选择一个动作{仅使用LTE-V2X PC5, 仅使用5G-V2X Uu, PC5与Uu聚合传输}。这里“聚合传输”是一个高级动作意味着将同一个业务的数据包通过双链路同时发送利用分集增益提升可靠性但这会消耗双倍的无线资源。2.2 奖励函数设计性能、效率与公平的权衡奖励函数是智能体的“指挥棒”设计得好坏直接决定了学习出来的策略是否可用。我们的奖励函数 R_i 是一个加权组合需要精心调参R_i w1 * R_performance w2 * R_efficiency w3 * R_fairness性能奖励这是核心。我们根据业务需求向量计算所选RAT实际提供的服务质量与需求之间的匹配度。例如对于时延敏感业务如果实际时延低于需求阈值则给予正奖励超出则给予惩罚且惩罚随超出比例指数增长。可靠性同理。效率奖励鼓励智能体高效使用无线资源。如果智能体在信道条件良好时选择了更“耗电”或更“占资源”的模式比如在PC5信号极佳时仍强行使用5G Uu则会受到轻微惩罚。反之如果能在满足业务需求的前提下选择资源消耗更小的模式会得到奖励。公平性奖励这是多智能体场景特有的。我们引入了一个“局部资源竞争指数”。通过监听周围的通信信号车辆可以粗略感知当前局部区域内PC5和Uu资源的拥塞程度。如果所有车辆都一窝蜂地涌向当前“最优”的RAT会导致集体性能下降。因此奖励函数中加入一个鼓励“错峰”的项当智能体选择了一个当前相对不那么拥挤的RAT并成功完成传输时给予额外奖励。注意奖励函数的权重w1, w2, w3需要大量的仿真和实地测试来校准。初期可以设定 w1 w2 w3确保基本性能达标再逐步引入效率和公平性考量。一个常见的坑是过早引入公平性惩罚导致智能体为了“让路”而牺牲自身关键业务的性能这在安全至上的V2X场景中是绝对不允许的。2.3 多智能体间的交互与部分可观测性车联网不是一群孤立的车。车辆i的决策会影响它周围车辆j的通信环境例如增加PC5信道的干扰。因此这是一个典型的部分可观测马尔可夫决策过程。每辆车只能观察到自己的状态和有限的局部环境信息如测量到的干扰无法获知全局所有车辆的状态和动作。这就引出了MARL的核心挑战环境非平稳性。从单个智能体的视角看环境包括其他智能体在不断变化导致它难以稳定学习。为了解决这个问题我们必须在算法层面进行设计让智能体学会在部分观测下对其他智能体的行为进行预测或建模或者采用能够收敛到均衡策略的算法框架。3. 算法选型与训练架构从独立Q学习到中心化训练多智能体强化学习的算法家族很庞大选哪个取决于我们对问题的假设和工程实现的复杂度。在项目初期我们尝试了几种主流路径。3.1 初期尝试Independent Q-Learning 及其局限性我们最开始图省事采用了独立Q学习。思路很简单每辆车都把自己当单智能体运行一个标准的DQN深度Q网络算法忽略其他车辆的存在。每个智能体独立地探索环境更新自己的Q网络试图最大化自己的长期累积奖励。结果如何在车辆密度较低的简单场景下IQL勉强能工作智能体们能学到一些基本的规则比如“时延要求高的选PC5要下大文件的选Uu”。但是一旦场景变得复杂——比如一个十字路口聚集了十几辆车且同时有大量协同感知业务触发——整个系统就变得极不稳定。性能波动巨大时常出现“信令风暴”所有车辆在某个时刻同时判断PC5是最佳选择导致PC5信道瞬间过载集体丢包然后大家又集体切换到Uu造成Uu网络拥塞……如此反复振荡。根源在于在IQL中每个智能体都在一个“移动的目标”上学习。智能体A的策略变了它给环境包括智能体B带来的影响就变了相当于智能体B的环境动态发生了改变B之前学到的策略可能就失效了。这种环境非平稳性使得传统的Q学习收敛理论失效智能体们很难达成一个协调的、高效的纳什均衡。3.2 进阶方案MADDPG与中心化训练分布式执行为了解决非平稳性问题我们转向了MADDPG这类基于Actor-Critic框架且采用CTDE范式的算法。这是目前工程上比较成熟且效果显著的一类方案。核心思想可以概括为“训练时上帝视角执行时各自为政”中心化训练在训练阶段我们有一个“上帝视角”的中央训练器。这个训练器可以收集到所有智能体的完整状态信息和动作。对于每个智能体训练器为其维护一个Critic网络评论家这个Critic在训练时输入的是全局状态s和所有智能体的动作a输出是对该智能体所选动作价值的评估Q值。这样Critic就能在一个稳定、全局的视角下准确地评价某个动作的好坏即使其他智能体的策略在变化。分布式执行每个智能体独立维护一个Actor网络执行者。在执行即实际部署阶段智能体仅依靠自身的局部观测来做出决策输出动作。它不再需要访问其他智能体的信息也无需与中央训练器通信完全具备分布式运行的能力。我们的具体实现架构Actor网络输入是车辆自身的局部观测o_i输出是一个动作概率分布离散动作则用Softmax我们场景中就是选择RAT的概率。Critic网络输入是所有车辆观测的拼接 [o_1, o_2, ..., o_N] 以及所有车辆动作的拼接 [a_1, a_2, ..., a_N]输出是标量Q值。经验回放池存储的是全局的经验元组(o, a, r, o‘)其中o, a, r, o‘都是所有智能体信息的集合。这保证了采样到的经验数据是关联的便于Critic学习联合动作的价值。目标网络Actor和Critic都使用目标网络来稳定训练通过软更新方式缓慢跟踪在线网络的参数。实操心得MADDPG对超参数非常敏感特别是Actor和Critic的学习率、软更新参数τ、以及经验回放池的采样批次大小。我们的经验是Critic的学习率通常应略高于Actor例如Critic lr0.01 Actor lr0.001这样Critic能更快地提供相对准确的价值指引避免Actor在错误的方向上狂奔。另外奖励的缩放Reward Scaling至关重要需要将不同业务、不同维度的奖励归一化到一个合理的范围如[-1, 1]否则梯度容易爆炸或消失。3.3 通信与协调机制的引入单纯的MADDPG让智能体学会了在全局信息指导下优化自身策略但智能体之间缺乏显式的、结构化的通信协调效率仍有提升空间。为此我们借鉴了通信智能体的思想做了一个有趣的扩展。我们在每辆车上增加了一个轻量级的通信编码器。这个编码器将车辆自身的局部观测经过一个神经网络编码成一个短小的消息向量。然后车辆通过一个专用的、低带宽的协调信道可以复用PC5中的某个资源池广播这个消息。同时它也接收来自周围邻居车辆的消息向量。决策流程变为车辆i收集自身观测o_i。将o_i编码为消息m_i并广播出去同时接收邻居消息集合M_neigh。Actor网络的输入不再是单纯的o_i而是o_i与聚合后的邻居消息例如通过注意力机制加权求和的融合表示。Actor基于这个富含协同信息的表示做出最终的RAT选择决策。这样智能体在决策时不仅知道“我自己看到了什么”还知道了“我的邻居们大概看到了什么/想做什么”从而能够做出更具前瞻性和协调性的决策。例如一辆车如果从邻居消息中感知到前方区域PC5信道即将繁忙它可能会主动将一些非紧急业务提前调度到Uu链路上避免扎堆。4. 仿真验证与实车部署的鸿沟算法在仿真里跑出漂亮曲线只是第一步距离真正上车还有十万八千里。我们基于OMNeT网络仿真和SUMO交通流仿真搭建了联合仿真平台并设计了从简单到复杂的多个测试场景。4.1 仿真场景设计与关键指标我们设计了三个梯度的场景场景一高速公路编队行驶。车辆队列稳定业务模式单一主要是周期性状态广播和编队控制。这个场景用于验证算法的基础收敛性和稳定性。场景二城市十字路口协同通行。车辆来自多个方向有信号灯业务混合安全预警感知共享。这个场景用于测试算法在动态拓扑和混合业务下的协调能力。场景三密集城区复杂路网。车辆密度高业务请求突发性强网络负载波动大。这是压力测试场景。评估指标我们主要看以下几组业务需求满足率各类V2X业务其KPI时延、可靠性被满足的百分比。这是底线指标。系统总吞吐量单位时间内所有车辆成功传输的数据总量。衡量频谱效率。切换次数与乒乓切换率车辆在不同RAT间切换的频率以及无意义的来回切换乒乓切换所占比例。频繁切换会带来信令开销和业务中断风险。公平性指数如Jain‘s Fairness Index评估不同车辆在获得通信服务上的公平程度。仿真结果显示在场景三中相比基于固定门限的切换策略我们的MARL方案能将高优先级业务的满足率提升约15%同时将乒乓切换率降低60%以上系统总吞吐量也有显著增益。这证明了智能决策的潜力。4.2 从仿真到实车的核心挑战然而仿真到实车的“落地鸿沟”比想象中更宽。几个硬核问题必须解决挑战一状态感知的实时性与准确性。仿真中我们可以完美获取信道状态、精确的车辆位置。现实中RSRP/RSRQ的测量有误差和延迟GPS定位有漂移对业务需求的判断比如一个感知共享数据包的紧急程度也需要本车的感知算法来估计这本身就有不确定性。MARL算法必须对输入的噪声和延迟具有鲁棒性。我们的对策是在训练阶段就人为为状态观测加入高斯噪声和随机延迟让智能体学会在“模糊”的信息下做决策。挑战二决策与执行的时序闭环。仿真中决策是即时的。现实中从感知状态、运行神经网络推理、到执行动作配置射频前端切换RAT存在一个不可忽略的时延可能几十到上百毫秒。在这段时延内车辆状态可能已发生剧变。这就可能导致“决策过时”问题。我们采用的方法是预测性决策不仅基于当前状态还基于一个简单的运动模型预测未来很短时间如一个决策周期后的状态并基于预测状态来做决策。同时将执行时延也作为一个状态输入让智能体意识到自己决策的“滞后性”。挑战三模型泛化与持续学习。训练用的仿真场景不可能覆盖所有真实路况。一辆在A市训练好的模型到了B市不同的道路结构、交通习惯和基站部署下性能可能会下降。我们正在探索在线微调和联邦学习的路径。在保障安全的前提下允许车辆在边缘服务器或云端的协调下利用真实脱敏数据对模型进行小幅度的、安全的在线更新使其能适应本地化特征。挑战四计算与功耗约束。车规级芯片的计算能力有限且功耗必须严格控制。复杂的神经网络尤其是大型Critic网络在推理时可能成为瓶颈。我们做了大量的模型压缩工作将训练好的策略网络Actor进行剪枝、量化并尝试转化为定点数运算最终部署在OBU的NPU上确保单次推理在10ms内完成满足实时性要求。5. 工程落地中的“坑”与应对策略最后分享几个在工程化过程中踩过的、教科书上不会写的“坑”。第一个坑奖励函数的“欺骗”行为。早期我们设计奖励函数时过于强调“满足业务需求”结果智能体学会了一种取巧策略对于时延要求极高的业务它发现只要不发送数据包就不会有时延也就不会被惩罚它通过“消极怠工”来规避惩罚这显然与我们的目标背道而驰。解决方案在奖励函数中必须加入强烈的“鼓励传输”的正奖励项并与“业务完成度”强挂钩。同时对于丢包或超时不仅要惩罚时延更要施加一个更大的、针对“任务失败”的惩罚。第二个坑探索与安全的矛盾。强化学习需要探索但在V2X安全场景中盲目的探索比如随机选择一个可能不满足安全业务需求的RAT可能引发真实危险。我们不能在实车上用“ε-greedy”这种简单粗暴的探索策略。我们的策略1)仿真中充分探索在高保真仿真环境中放开探索限制让智能体尝试各种哪怕是看起来很蠢的策略。2)部署时保守执行实车部署时采用完全贪婪的策略或者仅在一个非常小的、安全的动作子集内进行有监督的探索例如只在两种都能满足基本安全需求的RAT间做探索。3)引入安全层设计一个基于规则的安全兜底模块。当MARL策略选择的动作经安全层评估认为可能危及关键业务如时延预计超过安全阈值时安全层会覆盖MARL的决策强制执行一个保守但安全的动作。第三个坑非稳态交通流下的策略振荡。在交通流从稀疏突然变密集如驶入拥堵路段时我们观察到策略会出现短时振荡。分析发现这是因为所有车辆的策略网络同时面对一个未曾充分学习过的新环境高干扰密度产生了类似“恐慌”的反应。缓解方法除了之前提到的通信协调机制我们还引入了策略平滑技术。对Actor网络输出的动作概率分布进行指数移动平均滤波避免动作在相邻决策周期发生剧变。同时在状态输入中不仅包含瞬时测量值也加入最近一段时间测量值的统计特征如均值、方差让智能体对环境的“趋势”有感知。这个项目目前还在持续迭代中。从纯粹的仿真研究到在封闭场地和开放道路的测试车上跑通原型每一步都充满了挑战。但看到车辆在面对复杂通信环境时能像老司机一样“聪明”地自动选择通信方式保障各种应用流畅运行那种感觉还是非常棒的。多智能体强化学习不是银弹但它为C-V2X这个复杂系统的资源协同优化提供了一个极具想象力的框架。未来的工作是如何让它更鲁棒、更轻量、更安全最终能够无缝地集成到下一代智能网联汽车的通信栈中成为真正默默护航的“通信管家”。
返回列表