
2016年春天我蹲在一台改装测试车的副驾上笔记本电脑被一堆线束挤在角落车在园区里画了个完美的八字。当时的规划控制算法还谈不上智能无非是预描好一条参考线PID加LQR把车拴在路上走。那时我完全没想到接下来十年会是规划控制算法最跌宕起伏的一段历史——从规则写到学习从模块化到端到端再到2025年大家坐在一起讨论混合架构的落地量。回看这十年与其说是技术单点突破不如说是一场由算力、数据、法规和商业需求共同挤压出来的演进。这篇就是把2015到2025这十年间规划控制算法走过的关键拐点、踩过的坑和沉淀下来的共识按我的亲身经验尽量讲清楚。1. 架构路线的钟摆运动模块化、端到端与真正的产业分水岭智能驾驶规划控制这十年的起点远不是什么顶层设计推演出来的蓝图而是典型的工程驱动演进。2015到2017年那会儿主流玩家的技术架构高度相似高精地图多传感器融合定位感知模块输出障碍物列表行为决策层跑一个有限状态机规划层算出一条轨迹控制层去跟踪。整条链路上每一个模块都能拆出来单独做论文、单独做优化也是那时候大量博士生和工程师进入这个领域的原因——问题清晰、边界明确、指标可量化。这种感知-决策-规划-控制的经典模块化架构统治了行业几乎前五年。2018年之后随着BEV鸟瞰图感知和Transformer结构逐步成熟一个重要的趋势开始显现感知模块的输出质量大幅提升但规划控制模块却越来越成为瓶颈——不是算不出来轨迹而是面对复杂交互场景时靠手写规则根本覆盖不过来。于是行业开始出现两个方向的试探一个是在模块化架构内部把规则改成更复杂的模型比如用POMDP做决策、用强化学习优化策略另一个则是直接质疑整个架构用端到端把所有模块揉在一起。2023年FSD V12让端到端彻底破圈行业两边吵得不可开交。但真正在量产车里跑的既不是纯模块化也不是纯端到端而是各种形态的混合架构。我2024年参与过一个项目的技术评审系统架构图里感知是BEVTransformer决策规划部分换成了基于学习的交互预测规则兜底控制则依然是MPC加了安全约束。当时内部讨论的结论非常一致端到端代表上限模块化保住下限。1.1 前五年规则驱动的高光与暗面早期规划控制算法的聪明本质上是工程师聪明——把所有可能的驾驶场景拆成状态机转移把每一个行为边界写成可调参数。百度Apollo的EM Planner、Waymo早期基于规则的行为预测还有各路Tier 1的ACCLKA量产方案全部是这一套。规则方案最迷人的地方在于可调试性。接管问题、车道偏移、加塞响应每一个case都可以定位到具体的状态节点和cost函数系数。我记得2017年调一个匝道汇入场景问题出在相邻车道的车辆cost权重比目标车道的引导项低了0.05导致车辆在汇入点反复犹豫。这种问题换成现在的端到端架构你根本不知道从哪里下手。但规则的暗面也残酷。长尾场景的组合爆炸让规则数量以超线性增长而每个新规则都可能引入新的回归。到了2019年前后很多团队手上维护着上千条规则依然处理不了旁边车道的车打着灯但没变道施工桩桶和锥桶之间的开口小于一个车身宽这类边缘情况。这种无力感才是后来学习型方法真正切入规划控制的最直接动力。1.2 后五年数据驱动如何撬开决策规划的门缝2020年到2022年行业内对规划控制的学习化其实有过一波相当克制的尝试。主流方式是在行为决策层引入学习模型——用深度神经网络做驾驶员行为预测用强化学习优化驾驶策略但最终输出的安全兜底仍然交给经典规则。原因很简单法律法规和功能安全标准要求算法行为可解释、可验证纯学习模型在当时的工具链下过不了这一关。转机出现在2023年。端到端方案的量产验证让大家意识到只要数据规模足够大、车端算力足够强学习型方法完全可以在绝大多数场景里达到甚至超过规则方法的表现。更重要的是端到端方案把迭代变成了一个数据流水线问题——采集、挖掘、标注、训练、评测、部署整套闭环的效率革命直接碾压了手写规则。到2025年行业里几乎不再争论要不要学习转而讨论学习多少哪里兜底如何验证。但这并不是说模块化的经验作废了。恰恰相反正是早期规则时代积累的场景理解、安全边界定义和测试方法论让端到端方案有资格进入量产评审流程。这也解释了为什么混合架构是今天产业界的真正共识——它不是技术上的妥协而是工程成熟度的表现。2. 规划算法十年从找一条路到理解场景规划模块的演进本质上是对场景的表达方式在升级。我习惯把它分成三个阶段看前期的几何采样阶段、中期的语义优化阶段、后期的场景与交互建模阶段。2.1 前期Frenet坐标系、采样与Cost函数2015到2018年局部规划器的标准做法是在Frenet坐标系下工作。所谓Frenet坐标系就是沿参考线建立s纵向距离和l横向偏移两个正交轴把车辆运动从二维平面问题解耦成两个一维问题。这么做最大的好处是轨迹生成非常直观——纵向规划管好速度横向规划管好变道和避障最后再合成一条几何轨迹。轨迹生成有两种主流思路采样法和优化法。采样法如Lattice Planner在s-l空间里撒一堆候选点每组端状态对应一条五次多项式轨迹然后按cost函数排序。优化法如EM Planner则是先粗采样出一个凸空间再用二次规划在凸空间里求最优轨迹。这套方法到今天依然大量存在核心原因在于工程上非常可控。轨迹的曲率、加速度、jerk全部有显式约束安全校验可以逐点做。我调过很多次cost函数权重横向偏差、纵向加速度、与障碍物距离这三项权重调了两年最终也没找到一个全局最优只是找到一个在大部分场景下体验尚可的组合。2.2 中期语义栅格与Occupancy Network2019年之后一个关键的变化出现规划器输入从稀疏障碍物列表变成了稠密栅格的可通行空间。这个转变的推动力来自感知侧——BEV感知可以直接输出网格化的占用概率比3D框检测更稳、漏检率更低尤其在处理异形障碍物卡车货物、倒地的自行车、路沿时优势巨大。规划器跟随这个变化做了一个重大调整不再是找一条绕过N个障碍物的轨迹而是在一张可通行概率图上找一条最大通行裕度的轨迹。搜索算法如Hybrid A*可以直接在栅格图上做启发式搜索轨迹优化则变为对通行代价场的梯度下降。这个转变的代价是计算量上升了一个数量级。2019年我在一套Xavier平台上跑Occupancy版本的规划器单帧耗时接近80毫秒只能勉强达到实时的边缘。到Orin时代才算真正用得起。这也是为什么我说算法演进永远不是纯算法问题芯片算力的代差直接决定了能落地的技术档次。2.3 后期交互博弈与规划-预测联合优化2022年之后规划算法逐渐从自车为中心转向多智能体交互视角。传统规划器把其他交通参与者当成会移动的障碍物预测模块给它们的轨迹假设规划器在假设之上做优化。问题在于预测和规划是割裂的——预测不知道自车会怎么做规划把预测当成不变的输入遇到高度交互场景匝道、最终博弈、对向借道超车就频繁出现死锁或犹豫。解决办法是让两者联合优化。典型思路是建立交互博弈模型把场景里的每个参与者都建模为带意图的决策主体自车的规划器不仅要预测它们的行为还要考虑自己的行为对它们的影响。2023年我见过一个用博弈论框架做变道决策的方案效果比纯规则好很多尤其是面对你加速我也加速谁也不让步的僵持场景博弈框架能主动选择放弃变道并回到原车道而不是傻等。这类算法的落地仍在早期主要原因是计算复杂度和可验证性还不是产品级。但方向非常明确规划算法从几何问题变成了交互决策问题下一波AI能力的主要战场就在这里。3. 控制算法十年从跟住参考线到兼顾安全与体验规划层决定走哪条路控制层决定能不能稳稳地走过去。控制算法这十年的变化表面上没有规划那么戏剧化但细节里全是功夫。3.1 PID与LQR为什么老将始终没退场2025年了PID依然大量存在于量产车的纵向控制里。ACC的油门刹车控制底层几乎都是PID或PID加前馈。原因很简单纵向控制的对象是车辆纵向动力学模型不确定性大载重、坡度、风阻但控制目标相对简单——跟住前车距离和设定速度。PID用误差的比例、积分、微分三项去修正不需要精确模型也能稳定工作对嵌入式平台的算力需求几乎为零。横向控制的主流方案则是LQR线性二次型调节器。基本原理是把车辆-道路关系简化为一个线性状态空间模型以横向偏差、航向偏差、前轮转角等为状态设计最优状态反馈增益使得一个二次型代价函数最小。相比PIDLQR能显式考虑状态间的耦合在中等车速下跟踪效果稳定很多。但经典控制有个共同的天花板无法直接处理约束。转向角有物理极限、转向速率有限、横向加速度不能超极限这些在PID和LQR里只能通过限幅和增益调度去间接处理效果非常粗糙。我调过一辆车的紧急变道工况LQR的横向控制输出在转向速率上反复触限车辆画出了一个明显的S修正起来极为头疼。3.2 MPC入场预测时域带来的控制品质跃升2018年前后MPC模型预测控制从学术界大规模进入智能驾驶量产域。MPC的核心魅力在于每个控制周期内基于车辆动力学模型预测未来N步状态求解一个有限时域的最优控制问题同时把转向角极限、转向速率、横向加速度、横向偏差等全部编码为约束交给优化器统一处理。用MPC之后紧急变道的S彻底消失了。原因是控制器提前看到了未来几秒的状态变化约束不再被事后限幅生硬裁剪而是被事前规划平滑避开。2019年那会儿我在测试场验收一个新MPC控制器80km/h单车道紧急避障车辆轨迹平滑得像老司机打了一把预判方向盘。那次之后我对MPC的信任彻底建立了。MPC的代价是算力和调参复杂度。一个6×10秒时域的MPC在嵌入式平台上要把求解频率压到50Hz以上不是一件轻松的事。常见的做法是把预测模型简化为自行车模型优化问题转成二次规划QP用OSQP这类高效求解器在Orin上单帧耗时大约3到5毫秒这才算满足量产要求。3.3 横纵向解耦到协同极限工况的试金石早期量产方案通常把横向和纵向控制完全解耦横向管方向盘纵向管加速刹车两条链分别调参。这种方案在正常驾驶下没问题但一旦进入极限工况就露馅。比如高速大曲率弯道中如果纵向控制按常规舒适减速度刹车车辆重心前移导致后轮侧偏刚性下降横向控制要修正同样的弯道就需要更大的转向角而横向一变纵向又需要跟着调整速度——两个控制器各调各的车辆很容易出现弯中抖动或者弯中推头。真正的横向纵向协同控制在MPC里做联合优化是一个自然的选择把纵向加速度和转向角同时放进状态空间和cost函数让优化器自动在减速过弯和转向修正之间做权衡。2021年我实测过一组对比同一段连续弯道解耦控制平均需要通过3到4次转向修正维持车道协同控制全程只有一次轻微修正乘员感受天差地别。3.4 标定与调参控制算法只有一半在算法里控制算法能否达到最佳性能一半取决于算法本身另一半取决于标定。这个领域没有捷径就是海量的实车测试加数据迭代。我总结几个经验重心高、侧倾刚度不同车型的参数差异远超一般论文假设的范围任何控制算法落地前必须先做整车动力学参数辨识。轮胎的非线性在大侧偏角下非常明显线性模型参数需要做随车速、随载荷的增益调度来补偿。控制器的评价指标不要只看跟线误差还要看瞬态响应是否让乘员感到突兀。我在标定阶段引入了一个冲刺感打分项——纵向加速度变化率的峰值这个指标对舒适性的相关性远远高于RMS误差。控制算法的演进在过去十年里其实是相对平滑的并没有出现规划层那样颠覆式的路线之争。但这段平滑恰恰说明控制在工程上的成熟度更高新的技术比如学习型控制器如果没有压倒性的收益很难撼动已经经过可靠性验证的老方案。4. 隐形的第三只手芯片、法规与测试如何塑造算法形态规划控制十年演进如果只从算法内部找原因会漏掉一半叙事。真正决定哪些算法能上车的往往是算法之外的工程条件。4.1 算力从工控机到域控算法复杂度跟着芯片翻跟头2015年好多原型车用的是工控机高性能GPU整台机器的功耗相当于一台游戏本算法跑一帧的时间动不动一两百毫秒。那时候规划器只敢用小规模采样和一个简化cost函数原因不是不知道怎么做得更好而是算不过来。2020年之后Orin、高通SA8295P这类车规级大算力芯片量产情况彻底变了。以Orin为例单颗Orin的INT8算力达到275 TOPS足够把一个带Occupancy栅格和交互博弈的规划器塞进车规域控。MPC的求解频率也能从30Hz提到60Hz以上预测时域可以拉长到8秒。算力带来的一个隐含变化是算法团队可以大胆地尝试重方案。2023年我们在一颗Orin上同时跑了一个基于注意力机制的交互预测模型和一个多约束MPC整条链路的帧耗时还能控制在50毫秒以内。这在五年前根本不可想象。4.2 法规与SOTIF安全标准是算法行为的隐形编码ISO 26262功能安全、ISO 21448预期功能安全SOTIF、ISO 23247数据安全等标准体系在2018年后对量产智能驾驶算法形成了硬约束。对规划控制算法最直接的影响有两方面一是必须提供最小风险策略Minimal Risk ManeuverMRM——当系统检测到自身能力降级必须自动执行靠边停车等安全操作二是必须保证算法在未知名义场景下的鲁棒性不能只对见过的场景有效。MRM机制的引入意味着规划控制系统的独立性要求极高不能和主算法共用一套逻辑。很多团队在架构上单独建了一条安全通道用最保守的规则做兜底与主线规划完全隔离。这也是端到端方案量产会遇到的最大阻力之一——你可以让神经网络决定大多数情况的驾驶行为但法律不允许你让神经网络独自决定系统失效时怎么办。4.3 测试与数据闭环算法迭代的真正引擎规划控制算法好不好用最终要靠测试和数据说话。2015年那会儿测试基本靠场地一个刹车标定能在试车场跑几百圈2020年之后仿真测试的占比急速上升Cirrus、CARLA、自研仿真平台各显神通。行业通行的做法是先在仿真里跑数百万公里的场景库回归再上封闭场地做关键工况验证最后分批放开开放道路测试。这里有一个很关键的实践认知仿真和数据的价值不在于证明算法表现好而在于挖掘算法的边界。场景库必须刻意地找茬把边缘case、交互死锁、天气干扰全部灌给算法看它在哪一类场景下最先崩塌。一旦定位到崩塌点就有目标地采集数据、标注、训练或调整规则。2019年我们搭建数据闭环时一条典型的迭代链条是影子模式采集100万公里路测数据挖掘出1200个corner case人工标注后离线仿真筛选出37个有效问题最后修进算法版本。这样的节奏一个月能来两轮。5. 端到端与大模型的冲击规划控制工程师的价值迁移端到端算法和端到端概念在2023年彻底火起来之后规划控制这个岗位一度面临存在价值的拷问。作为经历过完整十年的人我的看法是这个岗位没有消失但工作内容的核心逻辑彻底变了。5.1 规则的极限就是端到端的起点前面说过手写规则在长尾场景里组合爆炸。当规则数量上千时每新增一条都会引出一堆回归问题而真正头疼的是很多驾驶员觉得危险、规则却判断正常的场景根本无法显式表达。比如前车在两条车道之间蛇形行驶它到底要左转还是右转规则写不出来但训练数据里包含了无数这样的人类操作范例。这就是端到端方案最核心的立身之本——把长尾场景的表达问题从人肉写规则变成数据自动提取。特斯拉的FSD V12之所以被视为分水岭不是因为它的算法构思多么精巧而是它证明了一个工程事实基于大规模视频数据的端到端驾驶策略可以覆盖绝大多数真实场景并且在交互行为上达到类人水平。5.2 端到端真的端到端了吗严格意义上的端到端是传感器输入直接映射到转向、加速、刹车指令中间没有任何显式模块。这类方案在2025年的量产车里几乎没有——即便FSD后面也加了种种安全检测网络和冗余规则。行业实际落地的是两种变体一种是感知-预测-规划联合训练的准端到端。感知不再是输出物体框而是输出隐式特征给规划头规划头直接生成轨迹点整个网络可以联合反向传播。另一种是模块化大模型改造感知输出BEV feature决策规划模块用一个场景理解大模型或用Transformer替代状态机做决策最后控制层依然是MPC。我自己的判断是2025到2030年间量产主流会是这两种变体的混合而纯模块化方案会继续在L2级辅助驾驶和商用车等保守领域存在。端到端的完全替代至少还需要解决可解释性验证、安全监管和corner case数据覆盖这三道关。5.3 规划控制工程师的新手艺十年前进规划控制岗位核心竞争力是懂Frenet坐标系、懂MPC推导、懂cost调参。2025年的规划控制工程师要做的事完全不同了我所在的团队技能栈已经转向行为数据的采集定义与挖掘你决定采集哪段路、什么天的时段、哪类驾驶行为是优秀样本比调参重要一个量级。场景评测与安全论证构建覆盖性强的场景库评估神经网络策略在OOD分布外场景的表现并对SOTIF标准做论证。混合架构设计与模块接口定义学习模块输出什么中间表达规则兜底模块在什么条件下接管两者交接如何避免突变。算法失效的归因分析端到端模型出错时下沉到隐空间和注意力图去判断是感知问题还是决策问题这需要同时懂网络架构和驾驶语义。这些变化对从业者来说意味着传统规划控制的手艺没有白学但必须主动去补数据工程、机器学习测试、系统安全设计这些新能力。6. 2025年的真实量产方案与未来两三年的收敛方向站在2025年回看行业其实已经不像2023年那么热闹该吵的技术路线问题基本吵完了剩下的都是硬骨头工程。不同定位的产品方案差异比想象中大。6.1 L2与L2的方案分野一个保守一个激进L2级辅助驾驶比如高速领航辅助NOA、城市记忆领航的量产方案主流是BEV感知交互预测规则决策规划MPC控制的混合架构。这套方案的优势是成熟、可靠、可解释计算量可控缺点是规则在真正复杂城市交互中还是跟不上。L4级Robotaxi方案则明显更激进多模态感知端到端决策规划安全MRM通道远程接管已经是头部玩家Waymo、百度Apollo、文远知行等的标配架构。Robotaxi能承担更高的传感器和算力成本也愿意接受更长的测试周期所以大规模车队的采集和长尾挖掘能力是它们相比L2厂商的最大屏障。6.2 交互博弈与场景大模型未来技术的两个主攻方向往后看两三年最值得关注的两个技术方向分别是一是交互博弈规划。前文提到过多智能体交互建模会走向实用。2025年的前沿方案多是在预测网络里引入意图解耦和博弈均衡求解下一步有望突破量产算力瓶颈把自车-他车-群体的联合策略显式建模进规划器。这个技术的落地会让车辆在加塞、合流、无保护左转等场景的决策水平跨上一个台阶。二是统一场景表达模型。2024年以来把感知、预测、可通行域合并为场景token喂给一个大模型由模型直接输出驾驶行为的趋势很明显。这类方案的核心竞争力在于大规模数据和超大规模算力的堆叠能力会进一步拉高行业的准入门槛。对中小团队来说与其自己从零训练一个大模型不如在开源模型基础上做场景适应和验证。6.3 安全底线无论架构怎么变补丁体系都要跟上说了这么多演进和变革有一条底线十年没变任何算法上车都必须有一个独立、可解释、足够保守的安全兜底。2024年多家公司发生的事故复盘问题大多出在系统很聪明地做了错误决定而不是系统瞎了。这意味着未来哪怕端到端Model成了绝对主流安全MRM、驾驶员监控、车辆状态合理性校验这些最不性感的模块反而会是决定商业成败的关键。我在最近的架构评审里一句话总结脑子和手脚都在变快但保险绳一定要握在不会犯错的人手里。这十年最大的变化其实不在代码和网络结构里而在做算法的方式上——从个人英雄主义的调参变成了数据-训练-评估-验证的工业化流水线。规划控制算法从一门手艺变成了一套工程体系这才是真正的十年分水岭。