Archives

Mathematical Principles of Reinforcement Learning 1 - Basic Concepts

本章核心目标 本章要建立强化学习后续所有章节都会反复使用的概念: 状态 state 动作 action 状态转移 state transition 策略 policy 奖励 reward 轨迹 trajectory、回报 return、回合 episode 马尔可夫决策过程 Markov decis