Skip to content

强化学习

本页速览 强化学习是第三种建模范式:没有标签也没有标准答案,只有环境反馈的奖励信号。本文讲清 MDP 框架、探索与利用、价值学习 vs 策略学习、深度强化学习(DQN/PPO),以及强化学习适合解决什么问题。

强化学习 ​

概念定义:在试错中学习决策 ​

监督学习有标签,无监督学习找结构,强化学习(Reinforcement Learning, RL)面对的是一种更苛刻的设定:没有标准答案,只有"事后奖励"。智能体(agent)与环境(environment)交互:观察状态 s,采取动作 a,环境返回新状态 s' 和奖励 r,如此循环。RL 的目标是学习一个策略(policy)π:状态 → 动作,使长期累积奖励最大化。

         ┌─────────────── 智能体 ───────────────┐
         │                                      │
         │  策略 π(a|s)  ←── 学习目标            │
         └──┬──────────────┬───────────────────┘
            │ 动作 a        │ 观察 s, 奖励 r
            ▼              ▲
         ┌───────────────────────────────────┐
         │           环境(环境动力学)        │
         └───────────────────────────────────┘

与监督/无监督的本质区别:

维度监督学习强化学习
数据形式标注好的 (x, y)交互产生的轨迹 (s, a, r, s')
反馈即时、每个样本都有延迟、稀疏(可能几十步后才给奖励)
目标拟合映射优化长期累计回报
关键难点泛化信用分配(哪一步该为最终结果负责)+ 探索

信用分配问题是 RL 的核心难题:一盘棋输了,是第 10 步还是第 40 步的错?奖励只在终点出现,如何把功劳/责任"分配"给中间每一步——这是价值函数存在的意义。

二、形式化框架:马尔可夫决策过程(MDP) ​

几乎所有 RL 问题都能写成 MDP,五个要素:

MDP = (S, A, P, R, γ)
 S  状态集合        A  动作集合
 P  状态转移概率    R  奖励函数
 γ  折扣因子 (0≤γ<1):越远期的奖励越打折

马尔可夫性质:下一状态只依赖当前状态和动作,与历史无关(p(s'|s,a))。折扣因子 γ 表达"今天的 1 块钱比明天的 1 块钱值钱"——γ 越接近 1 越"有远见",γ 越小越"短视"。

RL 要解的目标:找到策略 π 最大化累积折扣回报 G = Σ γᵗ rₜ。

三、探索与利用:RL 的第一性矛盾 ​

利用(exploitation):按当前已知最好的策略行动(稳);探索(exploration):尝试未知动作,可能发现更好的策略(险)。两者天然冲突——多臂老虎机(Multi-Armed Bandit)是研究这个问题的简化模型。

策略思想
ε-greedy以 ε 概率随机探索,否则贪心利用;ε 随时间衰减
UCB优先尝试"均值高 + 不确定性大"的动作(置信上界)
Thompson Sampling按后验概率采样动作,贝叶斯视角

工程口诀:训练前期多探索(ε 大),后期多利用(ε 小)。真实业务里(推荐、广告)常把探索单独设计成系统组件,因为探索会直接损失短期收入。

四、两大学习范式 ​

1. 价值学习:学"这个状态有多好" ​

  • 状态价值 V(s):从状态 s 出发,按策略 π 行动能获得的期望回报;
  • 动作价值 Q(s,a):在状态 s 采取动作 a 后的期望回报。

Q-learning(经典算法):用贝尔曼方程迭代更新 Q 表:

Q(s,a) ← Q(s,a) + α [ r + γ·maxₐ' Q(s',a') − Q(s,a) ]

其中 r + γ·max Q(s',a') 是"TD 目标"(当前奖励 + 下一状态最优价值),括号里是 TD 误差——用"预测的下一步"修正"当前的估计"。

DQN(Deep Q-Network, 2015):用神经网络近似 Q 函数,解决高维状态(如游戏画面)。两个关键工程技巧:

  • 经验回放(Replay Buffer):把历史转移 (s,a,r,s') 存起来随机抽样训练——打破样本相关性;
  • 目标网络(Target Network):TD 目标用独立的、缓慢更新的网络计算,稳定训练。

2. 策略学习:直接学"该怎么做" ​

Policy Gradient:直接优化策略网络 π(a|s),梯度方向 = "让高回报动作的概率上升"。PPO(Proximal Policy Optimization, 2017) 是策略梯度家族的事实标准:通过裁剪目标函数限制每步策略更新幅度,训练稳定、实现简单,是现代 RL 应用(游戏、机器人、大模型对齐)的默认选择。

Actor-Critic:价值 + 策略结合 ​

Actor(策略网络,决定动作)+ Critic(价值网络,评估动作好坏)。Critic 提供比原始奖励更细粒度的信号(优势函数),Actor 用这个信号更新策略。A3C、PPO、SAC 都属于 Actor-Critic 家族——它同时缓解了价值学习的高方差和策略学习的慢收敛。

五、深度强化学习的经典成就 ​

年份成果意义
2013/2015DQN 在 Atari 上超越人类深度学习 + RL 的开端(Nature 封面)
2016AlphaGo 4:1 战胜李世石价值网络 + 策略网络 + 蒙特卡洛树搜索(MCTS),AI 破圈
2017AlphaZero 从零自学围棋/国际象棋/将棋无需人类棋谱,纯自对弈强化学习
2019OpenAI Five / AlphaStar 战胜 Dota2 / 星际争霸职业选手复杂多智能体场景
2022+ChatGPT 的 RLHFRL 进入大模型:用人类反馈做奖励,对齐模型行为

最后一行值得展开:RLHF(基于人类反馈的强化学习) 把"人类偏好"变成奖励模型,再用 PPO 优化语言模型——这是大模型"从会说话到会聊天"的关键技术,也是 RL 第一次成为通用产品的核心组件。详见大语言模型(LLM)。

六、RL 适合解决什么问题 ​

RL 不是万能的,它有明确的适用边界:

适合不适合
决策是序列化的(一步影响下一步)单步决策(用监督/规则即可)
可以低成本试错(模拟器、游戏、日志回放)试错代价极高(医疗手术、贷款)
奖励可定义(赢/输、转化、能耗)奖励无法量化或会诱导作弊
环境可模拟或有大量交互数据数据只能被动观测(用离线 RL,仍难)

工程现实:RL 项目最大的成本是环境(模拟器)。AlphaGo 能成功,因为围棋有完美的模拟器;机器人 RL 难落地,因为真实物理环境试错太贵。绝大多数企业的 RL 应用集中在推荐、广告、调度等"有日志可以离线学习 + 上线小步试错"的场景。

奖励设计是 RL 的魔鬼

奖励函数写歪了,智能体就会"刷分":让机器人清理垃圾,它会先制造垃圾再清理(奖励多);让模型写广告文案,它会堆砌"吸睛"词。**Reward hacking(奖励钻空子)**是 RL 工程的头号陷阱,对策是奖励设计与安全护栏并重——这在大模型 RLHF 里尤其关键(模型学会"讨好标注者"而非"说真话")。

七、权衡与取舍 ​

  • 价值学习 vs 策略学习:连续动作空间(机器人、控制)用策略梯度/PPO(Q-learning 不适用于连续动作);离散动作可两者皆可。
  • 在线 vs 离线 RL:能交互用在线(PPO/SAC);只有历史数据用离线 RL(CQL 等),但离线 RL 对数据分布敏感,落地难。
  • 模型 vs 无模型:有环境动力学模型(model-based)数据效率高;无模型(model-free)通用但样本效率低。游戏/模拟用 model-based 收益大。
  • 探索成本:探索不足学不到最优,探索过度浪费资源——ε、UCB 参数要按场景调。

延伸阅读 ​

参考资料 ​