强化学习基础:奖励与策略

强化学习(RL)研究智能体如何与环境交互、用累积奖励最大化长期收益。它与监督学习不同:没有现成标签,只在行动后拿到奖励信号。AlphaGo 与机器人控制都建立在它之上。

基本元素

一个 RL 问题由智能体、环境、状态、动作与奖励构成。智能体在状态 s 下采取动作 a,环境给出奖励 r 与下一状态 s’。策略 π(a|s) 决定在各状态选什么动作。目标是最大化期望回报。

import gymnasium as gym

env = gym.make("CartPole-v1")
obs, _ = env.reset()
action = env.action_space.sample()      # 随机策略
obs, reward, terminated, truncated, _ = env.step(action)

价值与策略

价值函数衡量某状态或状态动作对的长期收益,是评估「好位置」的尺子。策略梯度方法直接对策略参数求梯度,让高回报动作的概率上升。Q-learning 等则学动作价值再据此选动作。

注意点

奖励设计是核心难点:奖励稀疏或错位会让智能体学到意外行为。训练样本间存在强相关,常用经验回放与目标网络稳定学习。小规模可用 Gymnasium 快速验证思路。

小结

强化学习通过智能体与环境的交互、以奖励为唯一监督来优化策略。理解状态、动作、奖励与价值函数后,再区分基于价值与基于策略的方法,是入门关键。

参考与延伸阅读

本文累计阅读