强化学习中的目标通常是某个期望,例如:
h(θ)=E[H(θ,X)]
但环境分布未知,只能获得随机样本 Xt。随机近似(Stochastic Approximation, SA)通过带噪声的增量更新,寻找方程 h(θ)=0 的根或目标函数的最优点。
Robbins-Monro 形式为:
θt+1=θt+αt[h(θt)+Mt+1]
其中 αt 是步长,Mt+1 表示零均值或鞅差噪声。
估计随机变量 X 的均值时,可以使用:
μt+1=μt+t+11(Xt+1−μt)
括号中的 Xt+1−μt 是当前样本给出的修正方向。强化学习中的许多更新也具有相同结构:
新估计=旧估计+步长×误差信号
经典收敛条件要求:
t=0∑∞αt=∞,t=0∑∞αt2<∞
第一项保证总更新量足够大,不会过早停止;第二项保证噪声的累计影响有限。常见选择为:
αt=(t+1)βc,21<β≤1
实际深度强化学习常使用固定或分段衰减学习率。它未必满足渐近收敛条件,但能持续适应数据分布和策略变化。
忽略噪声并把离散时间看作连续过程,SA 更新对应:
θ˙=h(θ)
如果该常微分方程的平衡点 θ∗ 是渐近稳定的,那么在适当条件下,随机迭代也会趋近 θ∗。这个视角常用于分析 TD learning、Q-learning 和 actor-critic 的收敛性。
以表格型 TD(0) 为例:
V(St)←V(St)+αtδt
其中:
δt=Rt+1+γV(St+1)−V(St)
TD 误差 δt 是对期望 Bellman 误差的随机观测。Q-learning 也可以写成:
Q(St,At)←Q(St,At)+αt[Rt+1+γamaxQ(St+1,a)−Q(St,At)]
Actor-Critic 同时更新价值参数 w 和策略参数 θ。常见分析让 critic 的步长 βt 大于 actor 的步长 αt:
βtαt→0
直观上,critic 在 actor 看来几乎已经完成对当前策略的评估,而 actor 则在 critic 看来缓慢变化。这样可以降低两个学习过程彼此追逐造成的不稳定。
随机更新中的噪声可以通过以下方法减弱:
- 增大 batch,使用多个样本的平均更新。
- 使用基线、控制变量或优势函数降低方差。
- 使用 Polyak-Ruppert averaging 对参数轨迹取平均。
- 对梯度或 TD 误差裁剪,限制极端样本的影响。
- 归一化观测、奖励或优势,改善不同维度的尺度。
调试随机近似算法时,应同时观察参数变化、误差信号和采样分布。学习率过大会导致震荡或发散,过小会使策略几乎不再改善;而数据相关性、非平稳目标和函数近似,又会让经典独立同分布假设不再成立。
随机近似提供了理解强化学习增量算法的统一语言:每次更新只是带噪声的一小步,但在合适的步长、稳定性和持续探索条件下,这些小步可以逼近一个确定的固定点。