Personal Knowledge Base

A long-term research and learning notebook for posts, notes, papers, projects, and research directions.

Skip to content
← Back to notes

强化学习 06:Stochastic Approximation

从 Robbins-Monro 递推理解随机近似,分析学习率、噪声与强化学习增量更新的收敛条件。

4 min read

为什么需要随机近似

强化学习中的目标通常是某个期望,例如:

h(θ)=E[H(θ,X)]h(\theta)=\mathbb{E}[H(\theta,X)]

但环境分布未知,只能获得随机样本 XtX_t。随机近似(Stochastic Approximation, SA)通过带噪声的增量更新,寻找方程 h(θ)=0h(\theta)=0 的根或目标函数的最优点。

Robbins-Monro 形式为:

θt+1=θt+αt[h(θt)+Mt+1]\theta_{t+1} =\theta_t+\alpha_t \left[h(\theta_t)+M_{t+1}\right]

其中 αt\alpha_t 是步长,Mt+1M_{t+1} 表示零均值或鞅差噪声。

样本均值是最简单的随机近似

估计随机变量 XX 的均值时,可以使用:

μt+1=μt+1t+1(Xt+1μt)\mu_{t+1} =\mu_t+\frac{1}{t+1}(X_{t+1}-\mu_t)

括号中的 Xt+1μtX_{t+1}-\mu_t 是当前样本给出的修正方向。强化学习中的许多更新也具有相同结构:

新估计=旧估计+步长×误差信号\text{新估计} =\text{旧估计} +\text{步长}\times\text{误差信号}

Robbins-Monro 步长条件

经典收敛条件要求:

t=0αt=,t=0αt2<\sum_{t=0}^{\infty}\alpha_t=\infty, \qquad \sum_{t=0}^{\infty}\alpha_t^2<\infty

第一项保证总更新量足够大,不会过早停止;第二项保证噪声的累计影响有限。常见选择为:

αt=c(t+1)β,12<β1\alpha_t=\frac{c}{(t+1)^\beta}, \qquad \frac{1}{2}<\beta\le 1

实际深度强化学习常使用固定或分段衰减学习率。它未必满足渐近收敛条件,但能持续适应数据分布和策略变化。

常微分方程视角

忽略噪声并把离散时间看作连续过程,SA 更新对应:

θ˙=h(θ)\dot{\theta}=h(\theta)

如果该常微分方程的平衡点 θ\theta^* 是渐近稳定的,那么在适当条件下,随机迭代也会趋近 θ\theta^*。这个视角常用于分析 TD learning、Q-learning 和 actor-critic 的收敛性。

强化学习更新的 SA 形式

以表格型 TD(0) 为例:

V(St)V(St)+αtδtV(S_t) \leftarrow V(S_t)+\alpha_t\delta_t

其中:

δt=Rt+1+γV(St+1)V(St)\delta_t =R_{t+1}+\gamma V(S_{t+1})-V(S_t)

TD 误差 δt\delta_t 是对期望 Bellman 误差的随机观测。Q-learning 也可以写成:

Q(St,At)Q(St,At)+αt[Rt+1+γmaxaQ(St+1,a)Q(St,At)]Q(S_t,A_t) \leftarrow Q(S_t,A_t)+\alpha_t \left[ R_{t+1}+\gamma\max_aQ(S_{t+1},a)-Q(S_t,A_t) \right]

多时间尺度随机近似

Actor-Critic 同时更新价值参数 ww 和策略参数 θ\theta。常见分析让 critic 的步长 βt\beta_t 大于 actor 的步长 αt\alpha_t

αtβt0\frac{\alpha_t}{\beta_t}\rightarrow 0

直观上,critic 在 actor 看来几乎已经完成对当前策略的评估,而 actor 则在 critic 看来缓慢变化。这样可以降低两个学习过程彼此追逐造成的不稳定。

方差控制与平均

随机更新中的噪声可以通过以下方法减弱:

  • 增大 batch,使用多个样本的平均更新。
  • 使用基线、控制变量或优势函数降低方差。
  • 使用 Polyak-Ruppert averaging 对参数轨迹取平均。
  • 对梯度或 TD 误差裁剪,限制极端样本的影响。
  • 归一化观测、奖励或优势,改善不同维度的尺度。

实践检查

调试随机近似算法时,应同时观察参数变化、误差信号和采样分布。学习率过大会导致震荡或发散,过小会使策略几乎不再改善;而数据相关性、非平稳目标和函数近似,又会让经典独立同分布假设不再成立。

随机近似提供了理解强化学习增量算法的统一语言:每次更新只是带噪声的一小步,但在合适的步长、稳定性和持续探索条件下,这些小步可以逼近一个确定的固定点。

Related Posts