论文11:38A Diffusion Approximation for Temporal-Difference Learning with Linear Features under Markovian Noise这篇论文从数学上解释了TD学习的误差为啥降不下去,用扩散近似把随机性的影响说清楚了。方法派、做强化学习理论的可以看看。#TD learning#线性函数近似#随机微分方程#策略评估aarXiv cs.LG@M. Forzo 等 4 人原文稍后读已读值得跟进有用关注 TD learning