先手动走迷宫,再让 Q-learning 通过奖励学习策略。每个格子的箭头表示当前最优动作,颜色表示价值大小。
迷宫中的位置是状态,上下左右是动作,每走一步环境都会返回奖励或惩罚。
ε 越大越愿意随机试错,ε 越小越依赖当前最优策略。强化学习总在两者之间取舍。
目标处的高奖励会通过更新公式逐步传回前面的格子,于是箭头开始指向一条可行路径。