
第 1 部分:DPG、PPO 中 Critic 与 DQN Critic 的原理对比:从价值函数学习到 Actor-Critic 优化机制1. 为什么强化学习需要 Critic?1.1 强化学习中的核心问题在强化学习(Reinforcement Learning,RL)中,一个智能体(Agent)不断与环境交互:状态(State)→动作(Action)→奖励(Reward) \text{状态(State)}\rightarrow\text{动作(Action)}\rightarrow\text{奖励(Reward)}状态(State)