论文11:42指数效用强化学习:折扣MDP的算法与收敛性该研究为指数效用目标下的RL提供了严格的值基算法与收敛证明,填补了理论空白。对风险敏感决策领域(如金融、自动驾驶)的实践者有重要参考价值。#强化学习#风险敏感#指数效用#Q学习aarXiv cs.LG原文稍后读已读值得跟进有用关注 强化学习