外观
强化学习
概念定义:在试错中学习决策
监督学习有标签,无监督学习找结构,强化学习(Reinforcement Learning, RL)面对的是一种更苛刻的设定:没有标准答案,只有"事后奖励"。智能体(agent)与环境(environment)交互:观察状态 s,采取动作 a,环境返回新状态 s' 和奖励 r,如此循环。RL 的目标是学习一个策略(policy)π:状态 → 动作,使长期累积奖励最大化。
┌─────────────── 智能体 ───────────────┐
│ │
│ 策略 π(a|s) ←── 学习目标 │
└──┬──────────────┬───────────────────┘
│ 动作 a │ 观察 s, 奖励 r
▼ ▲
┌───────────────────────────────────┐
│ 环境(环境动力学) │
└───────────────────────────────────┘与监督/无监督的本质区别:
| 维度 | 监督学习 | 强化学习 |
|---|---|---|
| 数据形式 | 标注好的 (x, y) | 交互产生的轨迹 (s, a, r, s') |
| 反馈 | 即时、每个样本都有 | 延迟、稀疏(可能几十步后才给奖励) |
| 目标 | 拟合映射 | 优化长期累计回报 |
| 关键难点 | 泛化 | 信用分配(哪一步该为最终结果负责)+ 探索 |
信用分配问题是 RL 的核心难题:一盘棋输了,是第 10 步还是第 40 步的错?奖励只在终点出现,如何把功劳/责任"分配"给中间每一步——这是价值函数存在的意义。
二、形式化框架:马尔可夫决策过程(MDP)
几乎所有 RL 问题都能写成 MDP,五个要素:
MDP = (S, A, P, R, γ)
S 状态集合 A 动作集合
P 状态转移概率 R 奖励函数
γ 折扣因子 (0≤γ<1):越远期的奖励越打折马尔可夫性质:下一状态只依赖当前状态和动作,与历史无关(p(s'|s,a))。折扣因子 γ 表达"今天的 1 块钱比明天的 1 块钱值钱"——γ 越接近 1 越"有远见",γ 越小越"短视"。
RL 要解的目标:找到策略 π 最大化累积折扣回报 G = Σ γᵗ rₜ。
三、探索与利用:RL 的第一性矛盾
利用(exploitation):按当前已知最好的策略行动(稳);探索(exploration):尝试未知动作,可能发现更好的策略(险)。两者天然冲突——多臂老虎机(Multi-Armed Bandit)是研究这个问题的简化模型。
| 策略 | 思想 |
|---|---|
| ε-greedy | 以 ε 概率随机探索,否则贪心利用;ε 随时间衰减 |
| UCB | 优先尝试"均值高 + 不确定性大"的动作(置信上界) |
| Thompson Sampling | 按后验概率采样动作,贝叶斯视角 |
工程口诀:训练前期多探索(ε 大),后期多利用(ε 小)。真实业务里(推荐、广告)常把探索单独设计成系统组件,因为探索会直接损失短期收入。
四、两大学习范式
1. 价值学习:学"这个状态有多好"
- 状态价值 V(s):从状态 s 出发,按策略 π 行动能获得的期望回报;
- 动作价值 Q(s,a):在状态 s 采取动作 a 后的期望回报。
Q-learning(经典算法):用贝尔曼方程迭代更新 Q 表:
Q(s,a) ← Q(s,a) + α [ r + γ·maxₐ' Q(s',a') − Q(s,a) ]其中 r + γ·max Q(s',a') 是"TD 目标"(当前奖励 + 下一状态最优价值),括号里是 TD 误差——用"预测的下一步"修正"当前的估计"。
DQN(Deep Q-Network, 2015):用神经网络近似 Q 函数,解决高维状态(如游戏画面)。两个关键工程技巧:
- 经验回放(Replay Buffer):把历史转移 (s,a,r,s') 存起来随机抽样训练——打破样本相关性;
- 目标网络(Target Network):TD 目标用独立的、缓慢更新的网络计算,稳定训练。
2. 策略学习:直接学"该怎么做"
Policy Gradient:直接优化策略网络 π(a|s),梯度方向 = "让高回报动作的概率上升"。PPO(Proximal Policy Optimization, 2017) 是策略梯度家族的事实标准:通过裁剪目标函数限制每步策略更新幅度,训练稳定、实现简单,是现代 RL 应用(游戏、机器人、大模型对齐)的默认选择。
Actor-Critic:价值 + 策略结合
Actor(策略网络,决定动作)+ Critic(价值网络,评估动作好坏)。Critic 提供比原始奖励更细粒度的信号(优势函数),Actor 用这个信号更新策略。A3C、PPO、SAC 都属于 Actor-Critic 家族——它同时缓解了价值学习的高方差和策略学习的慢收敛。
五、深度强化学习的经典成就
| 年份 | 成果 | 意义 |
|---|---|---|
| 2013/2015 | DQN 在 Atari 上超越人类 | 深度学习 + RL 的开端(Nature 封面) |
| 2016 | AlphaGo 4:1 战胜李世石 | 价值网络 + 策略网络 + 蒙特卡洛树搜索(MCTS),AI 破圈 |
| 2017 | AlphaZero 从零自学围棋/国际象棋/将棋 | 无需人类棋谱,纯自对弈强化学习 |
| 2019 | OpenAI Five / AlphaStar 战胜 Dota2 / 星际争霸职业选手 | 复杂多智能体场景 |
| 2022+ | ChatGPT 的 RLHF | RL 进入大模型:用人类反馈做奖励,对齐模型行为 |
最后一行值得展开:RLHF(基于人类反馈的强化学习) 把"人类偏好"变成奖励模型,再用 PPO 优化语言模型——这是大模型"从会说话到会聊天"的关键技术,也是 RL 第一次成为通用产品的核心组件。详见大语言模型(LLM)。
六、RL 适合解决什么问题
RL 不是万能的,它有明确的适用边界:
| 适合 | 不适合 |
|---|---|
| 决策是序列化的(一步影响下一步) | 单步决策(用监督/规则即可) |
| 可以低成本试错(模拟器、游戏、日志回放) | 试错代价极高(医疗手术、贷款) |
| 奖励可定义(赢/输、转化、能耗) | 奖励无法量化或会诱导作弊 |
| 环境可模拟或有大量交互数据 | 数据只能被动观测(用离线 RL,仍难) |
工程现实:RL 项目最大的成本是环境(模拟器)。AlphaGo 能成功,因为围棋有完美的模拟器;机器人 RL 难落地,因为真实物理环境试错太贵。绝大多数企业的 RL 应用集中在推荐、广告、调度等"有日志可以离线学习 + 上线小步试错"的场景。
奖励设计是 RL 的魔鬼
奖励函数写歪了,智能体就会"刷分":让机器人清理垃圾,它会先制造垃圾再清理(奖励多);让模型写广告文案,它会堆砌"吸睛"词。**Reward hacking(奖励钻空子)**是 RL 工程的头号陷阱,对策是奖励设计与安全护栏并重——这在大模型 RLHF 里尤其关键(模型学会"讨好标注者"而非"说真话")。
七、权衡与取舍
- 价值学习 vs 策略学习:连续动作空间(机器人、控制)用策略梯度/PPO(Q-learning 不适用于连续动作);离散动作可两者皆可。
- 在线 vs 离线 RL:能交互用在线(PPO/SAC);只有历史数据用离线 RL(CQL 等),但离线 RL 对数据分布敏感,落地难。
- 模型 vs 无模型:有环境动力学模型(model-based)数据效率高;无模型(model-free)通用但样本效率低。游戏/模拟用 model-based 收益大。
- 探索成本:探索不足学不到最优,探索过度浪费资源——ε、UCB 参数要按场景调。
延伸阅读
- 监督学习——三种范式的对照
- 无监督学习——第二种范式
- 强化学习应用——AlphaGo、机器人、推荐中的 RL
- 大语言模型(LLM)——RLHF 与对齐
- 数学基础速查——贝尔曼方程背后的动态规划
参考资料
- Sutton & Barto. Reinforcement Learning: An Introduction(2nd ed., 2018) —— RL 圣经,免费在线
- Mnih et al. Human-level control through deep reinforcement learning(DQN, Nature 2015)
- Schulman et al. Proximal Policy Optimization Algorithms(PPO, 2017)
- Silver et al. Mastering the game of Go with deep neural networks and tree search(AlphaGo, Nature 2016)
- Ouyang et al. Training language models to follow instructions with human feedback(InstructGPT/RLHF, 2022)
- OpenAI Spinning Up in Deep RL 教程 —— 深度 RL 入门最佳资源