论文Agent 与开发者10:26FERPO:前熵正则化策略优化算法新提出的FERPO算法解决了传统强化学习中critic值预测不准确的问题,在连续控制任务中表现优异。#FERPO#强化学习#策略优化#熵正则化aarXiv cs.LG@Sebastian Sanokowski 等 3 人原文稍后读已读值得跟进有用关注 FERPO