Skip to content

深度强化学习

本页速览 强化学习让智能体在试错中最大化累积奖励,深度 RL 则把神经网络变成它的"大脑"。本文讲清 MDP 设定、DQN 家族与 Actor-Critic 谱系、PPO/SAC 的定位,并延伸到探索-利用权衡、奖励设计以及 RLHF 对 LLM 的意义。

深度强化学习

一句话定义:强化学习(reinforcement learning, RL)研究一个智能体如何通过与环境的交互、依据"奖励信号"的反馈来学习最优行为策略;深度强化学习(deep RL)用神经网络作为策略/价值函数的近似器,让 RL 从表格型问题走向围棋、游戏、机器人控制等高维连续世界。

一、问题设定:MDP、状态、动作、奖励

RL 的标准数学框架是马尔可夫决策过程(MDP),五元组 <S, A, P, R, γ>

  • 状态 S:环境在时刻 t 的观测 s_t
  • 动作 A:智能体可选择的动作 a_t
  • 转移概率 PP(s'|s, a),环境对新状态的响应。
  • 奖励 Rr_t,一步行为的即时反馈。
  • 折扣因子 γ:未来奖励的折算,γ∈[0,1),让"远期奖励"贬值——与"及时满足"的直觉一致。

智能体的目标:最大化累积(折扣)奖励 G_t = Σ_k γᵏ·r_{t+k}

三个核心概念:

  • 策略 π(a|s):在状态 s 下选动作 a 的规则(策略网络就是它的函数近似)。
  • 状态价值函数 V(s):从 s 出发按策略 π 的期望累积奖励。
  • 动作价值函数 Q(s,a):在 s 先做 a、之后按 π 的期望累积奖励。两者满足贝尔曼方程(Bellman equation):V(s) = max_a [R(s,a) + γ·E[V(s')]]——把"未来价值"递归写成"当前奖励 + 下一状态价值",这是几乎所有 RL 算法的数学根基。

二、RL 与监督/无监督学习的关系

RL 位于监督与无监督的"中间地带",但又都不同:

  • 监督学习有正确答案(标签),RL 只有"奖励"——奖励是稀疏、延迟、可能带噪声的信号,没有"标准答案"告诉智能体哪一步错了。
  • 无监督学习从数据本身发现结构,RL 的结构来自"与环境互动产生的轨迹"。
  • 独特之处:RL 的数据由策略自己产生——数据分布随策略演化,这带来两大挑战:① 样本是相关的、非独立同分布;② 策略改变后,旧数据"过时"(分布漂移)。

这也是 RL 训练不稳、样本效率低的深层原因。它的评估也天然不同——没有固定测试集,只能重新跑环境采样,见深度学习评估与实验深度强化学习应用

三、DQN 及其改进:Double、Dueling、PER

**Deep Q-Network(DQN;Mnih et al., 2015)**是深度 RL 的里程碑:用神经网络拟合 Q 函数,在 Atari 游戏上达到超人水平。它解决"用深度网络做 RL"的三个技术难题:

  1. 经验回放(replay buffer):把历史转移 (s,a,r,s') 存进缓冲池,训练时随机抽样——打破样本相关性、提升样本复用(这是"打破独立同分布缺失"的对策)。
  2. 目标网络(target network):用一份延迟更新的参数算目标值 r + γ·max Q(s',a'),避免"自己追自己"导致发散。
  3. ∂Q/∂θ 的稳定性:损失 (r + γ·max Q(s',a') − Q(s,a))²,配合优化与梯度下降的 Adam 与梯度裁剪。

DQN 家族三大经典改进:

  • Double DQN(2016):用"当前网络选动作、目标网络给价值"解耦 max 操作,消除 Q 值过高估计。
  • Dueling DQN(2016):把 Q 拆成 V(s) + A(s,a)(状态价值 + 优势),让网络学到"哪些状态本身就有价值",提升泛化。
  • PER(Prioritized Experience Replay, 2016):按 TD 误差(预测与目标的差距)给样本加权抽样——把"错得多的样本"多学几遍,提升样本效率。

四、策略梯度与 Actor-Critic

价值方法(DQN 系)学 Q 再导出策略;**策略梯度(policy gradient)**直接对策略参数化并沿"期望奖励的梯度"更新:

∇θ J(θ) = E[ ∇θ log π(a|s) · A(s,a) ]

直觉:让"结果好于平均"的动作概率上升,差于平均的下降(A 是优势,见下)。策略梯度天然支持连续动作空间(DQN 对连续动作无能为力),这是它在机器人控制领域成为主力的原因。

**Actor-Critic(演员-评论家)**把两者结合:

  • Actor(策略):负责选动作,沿优势更新。
  • Critic(价值网络):负责给动作"打分"(估计优势 A = Q − V),供 Actor 使用。

分工像"车手 + 领航员":领航员提供比原始奖励更细粒度的反馈(优势),车手据此调整方向盘。这一家族包括 A2C/A3C、DDPG、TD3 等。

五、PPO 与 SAC:两个主力算法

PPO(Proximal Policy Optimization;Schulman et al., 2017)是当前应用最广的 RL 算法。它解决策略梯度"步子太大容易崩"的问题:用新旧策略的概率比 r(θ) = π_θ/π_old裁剪(clipping),把每次更新幅度限制在可信区间内——"每次只改进一点点,别一步登天"。

L = E[ min(r·A, clip(r, 1−ε, 1+ε)·A) ]

PPO 的优点:实现简单、超参数相对鲁棒、样本效率不错,OpenAI/DeepMind 的许多成果(Dota、ChatGPT 的 RLHF 阶段)都用它。

SAC(Soft Actor-Critic;Haarnoja et al., 2018)是连续控制领域的另一极:在目标里加入熵最大化项(鼓励随机性、主动探索),配合"软更新"与双 Q 网络,稳定性和样本效率都优秀。口诀:离散/大规模场景首选 PPO,连续控制考虑 SAC

六、探索-利用权衡

RL 的核心矛盾:探索(exploration)——试新动作收集信息 vs 利用(exploitation)——按已知最优行动。只利用会被局部最优困死,只探索则永远学不到最优。

经典机制:

  • ε-greedy:以 ε 概率随机动作(DQN 标配),简单但探索无向。
  • UCB / 置信区间:优先尝试"不确定性高"的动作。
  • 熵正则:让策略保持随机(SAC 的熵项、PPO 的熵 bonus)。
  • 内在奖励(curiosity):对"预测不准/新奇"的状态给额外奖励,鼓励探索未知区域。

七、样本效率与奖励设计

RL 两大现实痛点:

  1. 样本效率:训练一个 Atari 智能体要几千万步环境交互;真实机器人每步都是真金白银。对策:经验回放、模型预测控制(世界模型)、Sim-to-Real 迁移(仿真训练 + 现实微调)。
  2. 奖励设计:奖励信号是"学习目标"本身,设计不好就教出投机取巧的行为(reward hacking)——例如清洁机器人学会"把垃圾藏起来"而不是"清理掉"。原则:奖励要稀疏但语义正确,宁可少给信号也别给错信号;用奖励塑形(reward shaping)时注意不能改变最优策略。

数据与环境的工程化(仿真器、轨迹数据集)见数据与数据工程

八、RLHF:RL 进入 LLM

**RLHF(Reinforcement Learning from Human Feedback,人类反馈强化学习)**是 RL 在 LLM 上最重要的应用,也是 ChatGPT 成功的关键一环,流程三步:

  1. 收集偏好:让人对同一提示的两个回答排序(或打分)。
  2. 训练奖励模型(RM):用偏好数据训一个"预测哪个回答更好"的模型(就是损失函数与输出层里的排序/对比损失)。
  3. RL 微调:用 PPO 让 LLM 生成被 RM 打高分的回答——最大化 RM 分数 + KL 惩罚(KL 惩罚防止模型偏离 SFT 模型太远、胡言乱语)。

为什么 LLM 已能"预测下一个 token"还要 RLHF?因为**"下一个 token 概率高"≠"符合人类偏好"**(有用、无害、诚实)。RLHF 把人类偏好作为最终奖励,直接对齐模型行为。完整机制见大语言模型(LLM),后续的 DPO(直接偏好优化)等则绕开了奖励模型与 PPO,用更简单的方式实现对齐。

九、权衡与取舍

权衡与取舍

价值方法 vs 策略梯度:DQN 家族样本效率高、对离散动作友好,但连续动作与随机策略表达弱;策略梯度天然处理连续与随机策略,但方差大、样本效率低。Actor-Critic 是两者折中,PPO/SAC 是当前折中的工程化答案

样本效率 vs 实现复杂度:SAC 的熵正则提升了样本效率,但熵系数要调;PPO 简单鲁棒但样本效率一般。数据便宜(仿真)→ 上 PPO;数据昂贵(真实环境)→ 优先 SAC/世界模型。

探索的随机性 vs 收敛的稳定性:熵/内在奖励促进探索但拖慢收敛;探索不足则陷入次优。实践中用"退火"——训练前期多探索、后期收窄。

通用性 vs 任务特化:RL 算法对每个环境的奖励、状态编码都敏感(奖励缩放一改,超参数就崩),远不如监督学习"开箱即用"。RL 项目务必预留大块调参预算,配方见训练配方与调参

深度强化学习把"从经验中学习做决策"变成了工程现实:从游戏到机器人,再到大语言模型(LLM)的对齐。它的基础仍是神经网络基础里的网络与优化与梯度下降里的优化器——只是"数据"换成了策略自身产生的轨迹,这让它的每个环节(经验回放、目标网络、PPO 裁剪)都透着"如何驯服非独立同分布数据"的智慧。应用全景见深度强化学习应用

延伸阅读

参考资料