
第一章 DDPG简介1.1 强化学习与连续控制问题深度确定性策略梯度(Deep Deterministic Policy Gradient,DDPG)是一种经典的深度强化学习(Deep Reinforcement Learning,DRL)算法,主要用于解决连续动作空间(Continuous Action Space)下的控制问题。在传统强化学习(Reinforcement Learning,RL)中,智能体(Agent)不断与环境(Environment)进行交互,通过尝试不同动作获得奖励,并最终学习一个能够最大化长期收益的策略。整个强化学习过程可以表示为:St→At→Rt+1→St+1S_t\rightarrow A_t\rightarrow R_{t+1}\rightarrow S_{t+1}