← 返回实验室 Experiment 09 · Reinforcement Learning

强化学习迷宫

先手动走迷宫,再让 Q-learning 通过奖励学习策略。每个格子的箭头表示当前最优动作,颜色表示价值大小。

绿色为起点,紫色为目标,红色为陷阱。训练时 Q 值会从目标附近向外传播。
起点 目标 +100 陷阱 -50 奖励 +10

状态、动作、奖励

迷宫中的位置是状态,上下左右是动作,每走一步环境都会返回奖励或惩罚。

探索与利用

ε 越大越愿意随机试错,ε 越小越依赖当前最优策略。强化学习总在两者之间取舍。

Q 值如何传播

目标处的高奖励会通过更新公式逐步传回前面的格子,于是箭头开始指向一条可行路径。