ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

强化学习与控制理论的连接:从贝尔曼方程到LQR与MPC的深度融合

强化学习与控制理论的连接:从贝尔曼方程到LQR与MPC的深度融合 把强化学习和控制理论放在同一张桌上第一眼会觉得它们来自两个世界一个从奖励信号里学策略一个靠反馈回路维持稳定。但真正把数学结构展开后会发现它们描述的是同一个问题——在动态系统中做决策。控制理论默认有模型强化学习选择从数据里学模型控制理论关心稳定性、鲁棒性、约束满足强化学习关心探索、利用、长期回报。两套语言各说了一半合起来才是一个完整的决策理论。这篇文章围绕Foundations of Reinforcement Learning and Control: Connections and New Perspectives这个主题展开先拆解两个领域的基础概念和数学框架再分析它们的深层连接然后讨论几个值得关注的新视角稳定性约束、鲁棒性分析、安全控制、数据驱动控制。最后一节给出一个可运行的 Python 对照实验在同一个环境里演示 Q-learning 和 LQR 各自如何处理任务。适合正在做强化学习、但想理解控制理论视角的同学也适合做控制工程、想了解数据驱动方法如何接入的同学。1. 核心概念对应关系一张表看懂两个领域在深入数学之前先把两个领域的概念放在一起对照。你会发现很多名词只是换了一套叫法底层的结构高度相似。强化学习控制理论对应关系说明环境 Environment被控对象 Plant强化学习中的环境对应控制系统中需要控制的物理对象Agent / Policy控制器 Controller智能体学习策略对应控制器设计反馈律状态 State系统状态 State两者使用同一概念描述系统当前所处条件的变量集合动作 Action控制输入 Control Input智能体施加的动作对应控制器输出的控制量奖励 Reward代价函数 Cost Function强化学习最大化累计奖励控制理论最小化累计代价仅差一个符号折扣因子 γ时域与性能指标折扣因子影响长期回报的权重对应控制理论中对有限时域和无限时域的选择贝尔曼方程 Bellman Equation动态规划 / HJB 方程两者同源最优解的递归结构完全一致价值函数 Value Function值函数 / 李雅普诺夫函数候选价值函数评估状态好坏李雅普诺夫函数评估稳定性两者经常互相借用策略梯度 Policy Gradient参数优化 / 自适应律都是沿某个目标方向调整参数探索与利用激励信号与鲁棒设计探索对应控制理论中的扰动注入、主动激励无模型强化学习无模型自适应控制都不依赖精确模型直接从数据学习这张表是整篇文章的骨架。后面每一节的讨论基本都在展开这张表里某一行。2. 强化学习基础MDP、贝尔曼方程与策略优化强化学习的标准数学模型是马尔可夫决策过程Markov Decision Process, MDP。一个 MDP 可以用五元组表示M (S, A, P, R, γ)其中S 是状态集合A 是动作集合P(s|s, a) 是状态转移概率表示在状态 s 执行动作 a 后转移到状态 s 的概率R(s, a, s) 是奖励函数γ 是折扣因子取值范围 [0, 1]用来衡量未来奖励的重要性。强化学习的目标是找到一个策略 π(a|s)使得从任意初始状态出发的折扣累计奖励期望最大J(π) E[ Σ_{t0}^{∞} γ^t R(s_t, a_t, s_{t1}) | π ]这个目标函数和控制理论里的无限时域最优控制问题几乎完全对应。贝尔曼方程是这个问题的核心。对于确定性策略 π状态价值函数满足V^π(s) E_{a~π, s~P}[ R(s, a, s) γ V^π(s) ]最优价值函数 V* 满足贝尔曼最优方程V*(s) max_a E_{s~P}[ R(s, a, s) γ V*(s) ]从贝尔曼最优方程出发可以推导出两大类算法基于价值的算法Q-learning、DQN、SAC 等先学价值函数再从价值函数中提取策略基于策略的算法REINFORCE、PPO、TRPO 等直接对策略参数做梯度上升。下面的代码演示了最简单的 Q-learning 更新过程。这个例子是一个离散一维环境小车在 0 到 4 的轨道上移动目标是到达状态 4。import numpy as np # 离散一维任务小车在 [0, 4] 轨道上目标状态为 4 # 状态0, 1, 2, 3, 4 # 动作0 左移一步1 右移一步 # 到达目标状态 4 得到奖励 10其余移动奖励 -0.1 n_states 5 n_actions 2 Q np.zeros((n_states, n_actions)) alpha 0.1 # 学习率 gamma 0.95 # 折扣因子 epsilon 0.3 # 探索概率 episodes 500 # 训练回合数 def step(s, a): if a 0: ns max(s - 1, 0) else: ns min(s 1, n_states - 1) r 10.0 if ns 4 else -0.1 done (ns 4) return ns, r, done for _ in range(episodes): s np.random.choice([0, 1, 2, 3]) done False while not done: if np.random.rand() epsilon: a np.random.choice(n_actions) else: a int(np.argmax(Q[s])) ns, r, done step(s, a) # Q-learning 核心更新公式 Q[s, a] alpha * (r gamma * np.max(Q[ns]) - Q[s, a]) s ns print(训练后的 Q 表) print(Q) print(每个状态的最优动作, np.argmax(Q, axis1))这段代码的更新公式Q(s,a) - Q(s,a) α[ r γ max_{a} Q(s,a) - Q(s,a) ]这就是时序差分Temporal Difference, TD学习中最基础的一种。Q-learning 的经典之处在于它不需要知道状态转移概率 P只需要不断与环境交互从样本中估计最优价值函数。3. 控制理论基础状态空间、最优控制与模型预测控制控制理论的核心建模方式是状态空间模型。一个离散时间线性时不变系统写为x_{k1} A x_k B u_k y_k C x_k D u_k其中x_k 是系统状态向量u_k 是控制输入向量y_k 是系统输出向量A 是状态转移矩阵描述系统内部动态B 是输入矩阵描述控制作用如何影响状态C 是输出矩阵描述哪些状态被测量D 是直通矩阵通常为零。状态空间模型的价值在于它把系统动态、控制输入和测量输出统一到一个数学框架里。无论线性、非线性、时变还是时不变系统都可以用类似的形式表达只是矩阵可能变成函数。在线性系统理论中线性二次调节器Linear Quadratic Regulator, LQR是最经典的最优控制问题。它的目标是最小化一个二次型代价函数J Σ_{k0}^{∞} ( x_k^T Q x_k u_k^T R u_k )其中 Q 是状态代价矩阵R 是输入代价矩阵。LQR 的解是一个线性状态反馈u_k -K x_k反馈增益矩阵 K 由 Riccati 方程求解。下面的代码用 python-control 库计算 LQRimport numpy as np import control as ct # 离散时间双积分器模型x_{k1} A x_k B u_k A np.array([[1.0, 0.1], [0.0, 1.0]]) B np.array([[0.0], [1.0]]) # 状态代价矩阵和输入代价矩阵 Q np.diag([1.0, 1.0]) R np.array([[0.01]]) # 计算 LQR 反馈增益 K, S, E ct.lqr(A, B, Q, R) print(LQR 反馈增益 K:, K) print(Riccati 方程解 S:, S) print(闭环极点 E:, E)LQR 的优点在于解析解明确、计算代价低、稳定性有严格保证。Riccati 方程的解 S 同时也是系统的李雅普诺夫函数这一步在理论上保证了闭环系统的渐近稳定性。这是控制理论相对强化学习最明显的差异稳定性和性能有明确的数学证明。模型预测控制Model Predictive Control, MPC是另一个在工业界大量使用的最优控制方法。MPC 的思想是在每个时刻基于当前状态求解一个有限时域开环最优控制问题只执行第一个控制量然后滚动重复。MPC 的优化问题形式min Σ_{k0}^{N-1} ( x_k^T Q x_k u_k^T R u_k ) x_N^T Q_f x_N s.t. x_{k1} A x_k B u_k x_0 x_current x_k ∈ X, u_k ∈ U约束集 X 和 U 是 MPC 区别于 LQR 的关键。LQR 没有约束处理能力而 MPC 可以显式地处理输入饱和、状态边界和安全约束。下面是一个最小 MPC 循环的示意代码import numpy as np from scipy.optimize import minimize # 双积分器离散模型 A np.array([[1.0, 0.1], [0.0, 1.0]]) B np.array([[0.0], [1.0]]) N 10 # 预测时域 Q np.eye(2) # 状态代价 R np.array([[0.01]]) # 输入代价 def stage_cost(x, u): return x Q x u R u def mpc_objective(u_seq, x0): x x0.copy() J 0.0 for k in range(N): u_k np.array([u_seq[k]]) J stage_cost(x, u_k) x A x B u_k # 终端代价 J x Q x return J x0 np.array([2.0, 0.0]) # 滚动优化求解一次开环最优控制 res minimize(lambda u: mpc_objective(u, x0), np.zeros(N), methodSLSQP) u_opt res.x print(预测时域内的最优控制序列, u_opt) print(只执行第一个控制量, u_opt[0])实际应用中MPC 会在每个采样时刻重新求解这个优化问题这被称为滚动时域控制。MPC 的优势是显式处理约束缺点是依赖模型精度和在线优化计算速度。4. 两者的深层连接从最优控制到强化学习前面两节把两个领域的基础框架摆出来了。这一节要回答标题里的第一个关键词连接Connections。4.1 从 HJB 方程到贝尔曼方程最优控制理论在连续时间下的核心是汉密尔顿-雅可比-贝尔曼Hamilton-Jacobi-Bellman, HJB方程0 min_u { L(x, u) ∇_x V(x)^T f(x, u) }其中 L 是运行代价f 是系统动态V 是最优值函数。HJB 方程是连续时间无穷维偏微分方程只有在少数简单情况下有解析解。贝尔曼方程是 HJB 方程的离散时间版本V*(s) max_a { R(s,a) γ V*(s) }两者结构完全同构都是当前值 未来值的递归关系。区别在于 HJB 方程要求系统动态 f 完全已知而贝尔曼方程可以在不知道转移概率的情况下用采样数据来估计 V*。因此强化学习可以理解为当模型未知或难以建模时用数据逼近 HJB/贝尔曼方程的解。这个视角解释了为什么现代强化学习技术可以下沉到自动驾驶、机器人控制、能量系统优化等传统控制领域。4.2 最优控制与强化学习的等价性当强化学习遇到一个确定性的、离散时间环境并且奖励函数设置为负的代价函数时R(s, a) -L(s, a)强化学习的目标 J(π) E[Σ γ^t R] 就完全退化为一个带折扣因子的无限时域最优控制问题。反馈控制律、状态反馈、策略、控制器在这里指向同一个对象。在无模型场景下强化学习通常采用 Q-learning 或策略梯度这类方法直接学习策略或价值函数。在有模型场景下也可以用动态规划或轨迹优化。这也意味着强化学习和最优控制的算法可以互相迁移。比如先用系统辨识或动力学建模获得模型再用模型预测控制做安全轨迹优化最后用强化学习做策略微调或者先离线训练强化学习策略再用模型预测控制作为安全回退层在策略输出不满足约束时覆盖输出。这种混合架构在现代机器人控制和自动驾驶中已经比较常见。4.3 MPC 与基于模型的强化学习MPC 是一种有模型的方法。它基于已知或估计的模型做滚动优化。基于模型的强化学习Model-Based RL同样依赖一个学习到的环境模型用于想象 rollout、规划或训练策略。两者之间的差异在于MPC 通常使用白盒物理模型或近似线性模型强调优化求解Model-Based RL 使用神经网络模型或高斯过程模型强调从数据中学习模型的泛化能力MPC 有成熟的安全约束处理手段Model-Based RL 在模型误差较大时需要额外的鲁棒性设计近年来有大量工作把 MPC 与强化学习结合用一个学习到的模型替代 MPC 中的物理模型再用强化学习补偿模型误差带来的动态偏差。这个方向理论上讲得通落地时需要关注模型不确定性、实时性和稳定性证明不能只看基准数据集上的指标。4.4 自适应控制与在线强化学习自适应控制在控制理论中的位置与在线强化学习在机器学习中的位置非常类似。两者都面临模型参数未知且可能变化的挑战。自适应控制的主流思路是在线辨识系统参数基于最新参数更新控制器保证闭环系统稳定性。在线强化学习的思路是在当前策略下采集数据更新价值函数或策略参数在探索-利用之间做权衡。控制理论对流形自适应控制有严格的收敛性和稳定性分析但要求系统满足较强的假设条件。强化学习的假设更少适用范围更广稳定性和安全保证也更难。一个新视角是把自适应控制的参数辨识过程吸收进强化学习的隐状态表示中。比如用循环神经网络或 Transformer 处理部分可观测环境让策略网络自行推断系统参数的分布变化。这种思路本质上是把控制理论中的分离原理先辨识、再控制推广为融合式设计。5. 新视角一把控制理论的稳定性工具引入强化学习强化学习在复杂任务上表现很好但训练时好使、换场景就崩的问题也常见。这本质上是泛化性、鲁棒性和稳定性问题。控制理论在这些方面积累了近百年经验可以直接借用。5.1 李雅普诺夫稳定性与约束策略优化控制理论中稳定性的判断通常借助李雅普诺夫函数 V(x)如果存在一个正定函数 V使得沿系统轨迹有 V(x_{k1}) - V(x_k) 0则系统渐近稳定。强化学习中的价值函数 V(s) 在形式上和李雅普诺夫函数非常类似。差别在于价值函数衡量回报预期李雅普诺夫函数衡量能量衰减。实际上对大多数控制任务最优价值函数本身就可以构造出李雅普诺夫函数。这个思路催生了一个研究方向李雅普诺夫约束的强化学习。典型方法是在策略优化过程中加入约束条件要求每个状态下价值函数的期望必须下降E[V(s)] ≤ V(s) - c(s)这样可以直接把稳定性的物理意义塞进策略优化目标里。类似的工作包括 Constrained Policy OptimizationCPO、Lyapunov-based Actor-Critic 等方法。它们解决的问题很具体在处理安全控制系统时不仅希望奖励最大化还要求状态不发散、不进入危险区域。5.2 鲁棒控制视角下的分布偏移鲁棒控制理论解决的核心问题是当系统模型与实际系统之间存在不确定性时如何在最坏情况下保证系统性能。H∞ 控制、μ 综合等方法的出发点都是最坏情况设计。强化学习中的分布偏移问题即训练环境和测试环境不一致与鲁棒控制面对的问题非常相似。一个新视角是把环境动态的不确定性建模为有界扰动然后用鲁棒优化或对抗训练的方式训练策略。形式化地鲁棒强化学习的目标可以写为max_π min_{P ∈ P} E_{P}[Σ γ^t R(s_t, a_t)]其中 P 是一个包含所有可能转移概率的不确定性集合。控制理论里处理不确定性集合的技术积累正好可以迁移到这个问题的求解上。5.3 安全约束与可达集分析MPC 在处理安全约束时有一套成熟的可达集Reachable Set理论给定初始状态和控制输入边界计算状态在有限时间内可能到达的所有区域然后避免进入危险集合。强化学习的安全问题通常用约束马尔可夫决策过程Constrained MDP, CMDP建模。CMDP 在普通 MDP 目标之外增加一组约束E[Σ γ^t C_i(s_t, a_t)] ≤ d_i其中 C_i 是安全代价d_i 是安全阈值。这种建模方式与控制理论中状态必须保持在安全集内的概念高度一致。近年来的安全 RL 算法大量借鉴了 MPC 和可达集规划的思想在策略网络输出基础之上叠加一层安全筛选器仅在候选动作满足安全约束时才允许执行。6. 新视角二把强化学习的数据驱动思路引入控制反过来控制理论也可以从强化学习中吸收一些东西尤其是在系统模型难以用物理公式表达的场景里。6.1 无模型控制的本质传统控制理论以模型为中心建模成本很高。很多实际系统是强非线性、强耦合、参数时变的用一阶/二阶线性模型去近似经常不够用。无模型控制方法如 PID 整定、极值搜索控制本质上也是在不确定环境中通过试验调整控制律。这个过程和强化学习的探索学习是同构的。把这些方法统一来看控制器的参数可以写成向量 θ性能目标可以写成一个函数 J(θ)。无模型控制就是在没有解析梯度的情况下通过采样估计梯度并更新 θθ ← θ α ∇_θ J(θ)这就是策略梯度方法的基本形式。因此强化学习的策略梯度方法可以看作一种更通用的无模型控制器优化工具适用于优化目标复杂、难以用解析模型描述的控制器。6.2 自整定 PID 与奖励函数设计PID 控制器在工业控制中占据主导地位原因是结构简单、可靠性高、工程师熟悉。PID 参数整定通常靠经验规则比如 Ziegler-Nichols 方法或者手工调整。强化学习可以用于 PID 参数自动整定把 PID 增益作为策略参数定义代价函数为跟踪误差和输入变化的加权和使用策略梯度方法在仿真或真实系统上自动搜索最佳 PID 参数。这个思路在文献中被称为 auto-tuning落地价值高因为不需要改变现有控制架构只需要把原来的参数调整环节替换为数据驱动优化。这里的关键点是不需要把强化学习包装成替代 PID的先进算法更合理的方式是把它当成一个参数优化工具在既有控制结构之上提升性能。6.3 系统辨识与 world model系统辨识是控制理论中一个单独的学科方向研究如何从输入输出数据中建立数学模型。现代系统辨识方法已经大量使用机器学习工具比如高斯过程回归、神经网络、贝叶斯估计。基于模型的强化学习Model-Based RL第一步通常就是学一个 world model这个模型的作用和系统辨识中的被控对象模型完全一致。区别在于控制理论的系统辨识通常要求模型具备自噪声统计解释要给出置信区间Model-Based RL 只需要模型在训练分布上足够准确能让策略提升即可。一个值得尝试的结合方式是用控制理论的系统辨识方法比如预测误差法训练一个参数化模型再用强化学习在模型预测控制框架中做策略优化。这样既利用了模型的结构先验又利用了强化学习处理复杂目标的能力。7. 工程对照实验Q-learning 与 LQR 在同一个环境中这一节用一个具体的小实验演示两个方法如何在同一个动态系统中工作。环境是一个离散时间的一阶惯性系统x_{k1} x_k 0.1 * u_k目标是把状态从 x_0 2.0 拉回 0。代价函数设置为J Σ ( x_k^2 0.01 * u_k^2 )7.1 环境搭建先实现环境接口使用一个类来统一模拟状态转移import numpy as np class FirstOrderSystem: def __init__(self, x02.0): self.x x0 self.target 0.0 def reset(self): self.x 2.0 return self.x def step(self, u): # 系统动态x_{k1} x_k 0.1 * u self.x self.x 0.1 * u # 代价x^2 0.01 * u^2 cost self.x**2 0.01 * u**2 done abs(self.x) 0.05 return self.x, cost, done这里奖励是负的代价。强化学习的目标是把累计奖励最大化即累计代价最小化。7.2 LQR 求解对于这个一阶系统LQR 可以解析求解。状态方程是A 1.0 B 0.1代价权重 Q 1.0R 0.01。黎卡提方程的解会收敛到一个固定增益 K使 u -K x。import control as ct A np.array([[1.0]]) B np.array([[0.1]]) Q np.array([[1.0]]) R np.array([[0.01]]) K, S, E ct.lqr(A, B, Q, R) print(LQR 增益 K:, K)LQR 给出的控制律是 u -Kx是连续线性反馈没有约束没有探索直接一步到位。7.3 Q-learning 训练为了用 Q-learning 控制同一个系统需要把连续状态离散化。简化处理把状态 x 量化到区间 [-3, 3] 内的 61 个网格点动作 u 也限制在离散集合 {-1.0, 0.0, 1.0} 中。import numpy as np # 状态离散化 state_grid np.linspace(-3.0, 3.0, 61) action_set np.array([-1.0, 0.0, 1.0]) def discretize_state(x): return int(np.argmin(np.abs(state_grid - x))) # 初始化 Q 表 Q np.zeros((len(state_grid), len(action_set))) alpha 0.3 gamma 0.95 epsilon 0.2 episodes 2000 for _ in range(episodes): env FirstOrderSystem() s env.reset() done False while not done: si discretize_state(s) if np.random.rand() epsilon: a_idx np.random.choice(len(action_set)) else: a_idx int(np.argmax(Q[si])) u action_set[a_idx] ns, cost, done env.step(u) ni discretize_state(ns) r -cost Q[si, a_idx] alpha * (r gamma * np.max(Q[ni]) - Q[si, a_idx]) s ns print(Q-learning 训练完成)7.4 两者对比观察从代码结构上看两个方法差异明显LQR 直接给出一个反馈增益不需要任何环境交互数据Q-learning 需要上千次试错才能逼近一个离散动作策略LQR 的控制输出连续平滑Q-learning 的控制输出在离散动作之间跳动会产生一定的颤振LQR 有稳定性保证Q-learning 的结果依赖超参数和探索策略换一个随机种子表现可能不一样。这个对照实验说明一个问题当模型已知且代价函数是二次型时LQR 是最优选择当模型复杂、无法解析建模时强化学习的价值才真正体现出来。工程中常见的做法是优先用控制理论方法榨干模型信息再对模型误差部分用强化学习补偿。8. 工具链与库选择做强化学习和控制理论交叉研究可以按下面的方式选择工具。领域库/工具用途强化学习环境Gymnasium、dm_env构建标准环境接口方便测试算法强化学习算法Stable-Baselines3、CleanRL、Ray RLlib已经实现 PPO、SAC、TD3 等主流算法自定义策略训练PyTorch、TensorFlow自定义网络结构和训练流程控制理论计算python-controlLQR、极点配置、频域分析、状态空间仿真模型预测控制CasADi、do-mpc、acados非线性 MPC、直接优化求解系统辨识Slycot、GEKKO从数据中估计系统模型参数鲁棒控制MATLAB Robust Control ToolboxH∞、μ 综合等设计MATLAB 生态最完整可视化Matplotlib、Plotly绘制状态轨迹、控制输入曲线、代价收敛曲线如果只是做学习验证推荐 Python 环境Gymnasium Stable-Baselines3 python-control 的组合足够覆盖大部分实验。如果做工业级控制器设计MATLAB 的鲁棒控制工具箱会更顺手但商业授权成本需要单独考虑。9. 常见误区与排查思路两个领域交叉时最容易出现概念混淆和工程问题。下面整理一份自查表。误区/问题真实情况排查思路强化学习一定比 PID 好RL 需要大量试错数据且没有安全性保证在模型简单的场景PID/LQR 效率更高先用传统控制方法建立基线再判断 RL 是否有必要无模型 RL 不需要模型无模型只是不在策略中显式建模但训练过程仍然需要环境交互数据在真实系统中代价很高考虑先用仿真环境或离线数据训练再微调MPC 只是 RL 的一种特殊情况MPC 的核心价值是显式处理约束RL 的核心价值是从数据中学习策略适用场景不同比较时先确认是否有约束、是否有模型、是否有实时性要求价值函数就是李雅普诺夫函数价值函数衡量回报李雅普诺夫函数衡量稳定性只有满足特定条件下两者才等价需要额外验证单调下降条件不能直接互相替代训练时收敛就能部署分布偏移可能导致 RL 策略在真实环境中失效对比训练环境与目标环境的动态差异评估鲁棒性CUDA/库版本冲突强化学习框架和科学计算库经常冲突使用独立虚拟环境锁定依赖版本实验复现性差RL 的随机性来自策略探索和神经网络初始化固定随机种子记录完整超参数配置控制算法表现差状态空间模型、代价权重、约束设置都可能偏差先单独验证模型预测精度再调试控制器参数实际项目里与其纠结用 RL 还是控制理论不如把两者当成互补工具箱。模型结构清楚的部分交给控制理论模型不确定性大的部分交给数据驱动方法安全关键路径保留硬约束和人工干预通道。10. 总结与下一步尝试强化学习和控制理论不是对立关系而是一条连续谱的两端。控制理论提供稳定性、鲁棒性、约束处理和系统分析工具强化学习提供非线性表示、探索机制、数据驱动优化方法。真正有价值的工作在这条谱系中间既需要模型保证安全底线又需要通过数据应对不确定性。建议你接下来的尝试路径先在一个简单系统上复现 LQR 和 Q-learning对照它们的状态轨迹直观理解有模型和无模型的差别在环境模型中人为加入扰动观察两种方法的鲁棒性差异用一个带输入约束的任务验证 MPC 相对 LQR 的优势再进一步用强化学习在 MPC 基础之上做参数调整体会混合架构的工作方式。最容易踩的坑是拿着传统实验指标直接比较两个框架的效率这通常会得出RL 很慢、LQR 很快的结论但忽略了适用场景差异。正确的比较方式应该带上具体任务约束模型是否已知是否存在约束是否有安全边界数据获取成本是多少。推荐的后续扩展方向包括安全强化学习、鲁棒模型预测控制、数据驱动动态建模、以及把 Learning-based Model Predictive Control 这类方法应用到实际机器人任务中。这些方向都需要强化学习和控制理论两套知识哪一边先起步都可以关键是尽早让两个框架在自己的项目里真正合作一次。
返回列表