外观
深度强化学习
一句话定义:强化学习(reinforcement learning, RL)研究一个智能体如何通过与环境的交互、依据"奖励信号"的反馈来学习最优行为策略;深度强化学习(deep RL)用神经网络作为策略/价值函数的近似器,让 RL 从表格型问题走向围棋、游戏、机器人控制等高维连续世界。
一、问题设定:MDP、状态、动作、奖励
RL 的标准数学框架是马尔可夫决策过程(MDP),五元组 <S, A, P, R, γ>:
- 状态 S:环境在时刻 t 的观测
s_t。 - 动作 A:智能体可选择的动作
a_t。 - 转移概率 P:
P(s'|s, a),环境对新状态的响应。 - 奖励 R:
r_t,一步行为的即时反馈。 - 折扣因子 γ:未来奖励的折算,
γ∈[0,1),让"远期奖励"贬值——与"及时满足"的直觉一致。
智能体的目标:最大化累积(折扣)奖励 G_t = Σ_k γᵏ·r_{t+k}。
三个核心概念:
- 策略 π(a|s):在状态 s 下选动作 a 的规则(策略网络就是它的函数近似)。
- 状态价值函数 V(s):从 s 出发按策略 π 的期望累积奖励。
- 动作价值函数 Q(s,a):在 s 先做 a、之后按 π 的期望累积奖励。两者满足贝尔曼方程(Bellman equation):
V(s) = max_a [R(s,a) + γ·E[V(s')]]——把"未来价值"递归写成"当前奖励 + 下一状态价值",这是几乎所有 RL 算法的数学根基。
二、RL 与监督/无监督学习的关系
RL 位于监督与无监督的"中间地带",但又都不同:
- 监督学习有正确答案(标签),RL 只有"奖励"——奖励是稀疏、延迟、可能带噪声的信号,没有"标准答案"告诉智能体哪一步错了。
- 无监督学习从数据本身发现结构,RL 的结构来自"与环境互动产生的轨迹"。
- 独特之处:RL 的数据由策略自己产生——数据分布随策略演化,这带来两大挑战:① 样本是相关的、非独立同分布;② 策略改变后,旧数据"过时"(分布漂移)。
这也是 RL 训练不稳、样本效率低的深层原因。它的评估也天然不同——没有固定测试集,只能重新跑环境采样,见深度学习评估与实验与深度强化学习应用。
三、DQN 及其改进:Double、Dueling、PER
**Deep Q-Network(DQN;Mnih et al., 2015)**是深度 RL 的里程碑:用神经网络拟合 Q 函数,在 Atari 游戏上达到超人水平。它解决"用深度网络做 RL"的三个技术难题:
- 经验回放(replay buffer):把历史转移
(s,a,r,s')存进缓冲池,训练时随机抽样——打破样本相关性、提升样本复用(这是"打破独立同分布缺失"的对策)。 - 目标网络(target network):用一份延迟更新的参数算目标值
r + γ·max Q(s',a'),避免"自己追自己"导致发散。 - ∂Q/∂θ 的稳定性:损失
(r + γ·max Q(s',a') − Q(s,a))²,配合优化与梯度下降的 Adam 与梯度裁剪。
DQN 家族三大经典改进:
- Double DQN(2016):用"当前网络选动作、目标网络给价值"解耦 max 操作,消除 Q 值过高估计。
- Dueling DQN(2016):把 Q 拆成
V(s) + A(s,a)(状态价值 + 优势),让网络学到"哪些状态本身就有价值",提升泛化。 - PER(Prioritized Experience Replay, 2016):按 TD 误差(预测与目标的差距)给样本加权抽样——把"错得多的样本"多学几遍,提升样本效率。
四、策略梯度与 Actor-Critic
价值方法(DQN 系)学 Q 再导出策略;**策略梯度(policy gradient)**直接对策略参数化并沿"期望奖励的梯度"更新:
∇θ J(θ) = E[ ∇θ log π(a|s) · A(s,a) ]直觉:让"结果好于平均"的动作概率上升,差于平均的下降(A 是优势,见下)。策略梯度天然支持连续动作空间(DQN 对连续动作无能为力),这是它在机器人控制领域成为主力的原因。
**Actor-Critic(演员-评论家)**把两者结合:
- Actor(策略):负责选动作,沿优势更新。
- Critic(价值网络):负责给动作"打分"(估计优势
A = Q − V),供 Actor 使用。
分工像"车手 + 领航员":领航员提供比原始奖励更细粒度的反馈(优势),车手据此调整方向盘。这一家族包括 A2C/A3C、DDPG、TD3 等。
五、PPO 与 SAC:两个主力算法
PPO(Proximal Policy Optimization;Schulman et al., 2017)是当前应用最广的 RL 算法。它解决策略梯度"步子太大容易崩"的问题:用新旧策略的概率比 r(θ) = π_θ/π_old 做裁剪(clipping),把每次更新幅度限制在可信区间内——"每次只改进一点点,别一步登天"。
L = E[ min(r·A, clip(r, 1−ε, 1+ε)·A) ]PPO 的优点:实现简单、超参数相对鲁棒、样本效率不错,OpenAI/DeepMind 的许多成果(Dota、ChatGPT 的 RLHF 阶段)都用它。
SAC(Soft Actor-Critic;Haarnoja et al., 2018)是连续控制领域的另一极:在目标里加入熵最大化项(鼓励随机性、主动探索),配合"软更新"与双 Q 网络,稳定性和样本效率都优秀。口诀:离散/大规模场景首选 PPO,连续控制考虑 SAC。
六、探索-利用权衡
RL 的核心矛盾:探索(exploration)——试新动作收集信息 vs 利用(exploitation)——按已知最优行动。只利用会被局部最优困死,只探索则永远学不到最优。
经典机制:
- ε-greedy:以 ε 概率随机动作(DQN 标配),简单但探索无向。
- UCB / 置信区间:优先尝试"不确定性高"的动作。
- 熵正则:让策略保持随机(SAC 的熵项、PPO 的熵 bonus)。
- 内在奖励(curiosity):对"预测不准/新奇"的状态给额外奖励,鼓励探索未知区域。
七、样本效率与奖励设计
RL 两大现实痛点:
- 样本效率:训练一个 Atari 智能体要几千万步环境交互;真实机器人每步都是真金白银。对策:经验回放、模型预测控制(世界模型)、Sim-to-Real 迁移(仿真训练 + 现实微调)。
- 奖励设计:奖励信号是"学习目标"本身,设计不好就教出投机取巧的行为(reward hacking)——例如清洁机器人学会"把垃圾藏起来"而不是"清理掉"。原则:奖励要稀疏但语义正确,宁可少给信号也别给错信号;用奖励塑形(reward shaping)时注意不能改变最优策略。
数据与环境的工程化(仿真器、轨迹数据集)见数据与数据工程。
八、RLHF:RL 进入 LLM
**RLHF(Reinforcement Learning from Human Feedback,人类反馈强化学习)**是 RL 在 LLM 上最重要的应用,也是 ChatGPT 成功的关键一环,流程三步:
- 收集偏好:让人对同一提示的两个回答排序(或打分)。
- 训练奖励模型(RM):用偏好数据训一个"预测哪个回答更好"的模型(就是损失函数与输出层里的排序/对比损失)。
- RL 微调:用 PPO 让 LLM 生成被 RM 打高分的回答——最大化
RM 分数 + KL 惩罚(KL 惩罚防止模型偏离 SFT 模型太远、胡言乱语)。
为什么 LLM 已能"预测下一个 token"还要 RLHF?因为**"下一个 token 概率高"≠"符合人类偏好"**(有用、无害、诚实)。RLHF 把人类偏好作为最终奖励,直接对齐模型行为。完整机制见大语言模型(LLM),后续的 DPO(直接偏好优化)等则绕开了奖励模型与 PPO,用更简单的方式实现对齐。
九、权衡与取舍
权衡与取舍
价值方法 vs 策略梯度:DQN 家族样本效率高、对离散动作友好,但连续动作与随机策略表达弱;策略梯度天然处理连续与随机策略,但方差大、样本效率低。Actor-Critic 是两者折中,PPO/SAC 是当前折中的工程化答案。
样本效率 vs 实现复杂度:SAC 的熵正则提升了样本效率,但熵系数要调;PPO 简单鲁棒但样本效率一般。数据便宜(仿真)→ 上 PPO;数据昂贵(真实环境)→ 优先 SAC/世界模型。
探索的随机性 vs 收敛的稳定性:熵/内在奖励促进探索但拖慢收敛;探索不足则陷入次优。实践中用"退火"——训练前期多探索、后期收窄。
通用性 vs 任务特化:RL 算法对每个环境的奖励、状态编码都敏感(奖励缩放一改,超参数就崩),远不如监督学习"开箱即用"。RL 项目务必预留大块调参预算,配方见训练配方与调参。
深度强化学习把"从经验中学习做决策"变成了工程现实:从游戏到机器人,再到大语言模型(LLM)的对齐。它的基础仍是神经网络基础里的网络与优化与梯度下降里的优化器——只是"数据"换成了策略自身产生的轨迹,这让它的每个环节(经验回放、目标网络、PPO 裁剪)都透着"如何驯服非独立同分布数据"的智慧。应用全景见深度强化学习应用。
延伸阅读
- 神经网络基础——策略与价值网络的骨架
- 深度学习评估与实验——RL 的评估与样本效率
- 反向传播与自动微分——策略梯度更新的梯度基础
- 生成式模型——从自回归生成看序列决策
- 调试与诊断——reward 不涨的排查
- 常见陷阱与反模式——RL 项目常见的坑
参考资料
- Mnih et al. Human-level control through deep reinforcement learning (Nature, 2015, DQN)
- Schulman et al. Proximal Policy Optimization Algorithms (2017, PPO)
- Haarnoja et al. Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor (2018, SAC)
- van Hasselt, Guez, Silver. Deep Reinforcement Learning with Double Q-learning (2016)
- Schaul et al. Prioritized Experience Replay (2016)
- Ouyang et al. Training language models to follow instructions with human feedback (2022, InstructGPT)