ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

RL-07-赵-不基于模型2-计算Q/ActionValue-TD算法04:Q-Learning02【On-policy:行为策略=目标策略】【Off-policy:行为策略≠目标策略】

RL-07-赵-不基于模型2-计算Q/ActionValue-TD算法04:Q-Learning02【On-policy:行为策略=目标策略】【Off-policy:行为策略≠目标策略】 RL-赵-(七)-不基于模型5:Q-Learning【TD算法】【离线】【基于RM算法在无模型条件下求解贝尔曼最优公式->直接计算出最优ActionValue->直接更新目标π】【无需PE与PI迭代】二、Off-policy、On-policy在深入研究Q-learning之前,我们首先介绍两个重要的概念,首先,在TD learning task中存在两个策略:第一个是behav
返回列表