10:21官方账号arXiv cs.LG@Zahra Abdalla Elashaal, Afef Hfaiedh, Nahla Khraief, Issmail Ellabib, Giansalvo Cirrincione论文提出一种两层分层强化学习(HRL)框架,高层负责策略规划,底层采用连续控制算法Soft Actor-Critic(SAC),并通过熵正则化策略优化。该框架在Search-and-Rescue-2(SAR-2)数据集上训练和评估。HRL-SAC在成功率、覆盖效率和收敛速度上均优于普通SAC基线,有效解决延迟奖励和连续控制问题。实验表明分层熵正则化策略是处理长视野稀疏奖励任务的有前景方案。论文Hierarchical Soft Actor-CriticSACSAR-2推荐理由:这篇论文教你用分层SAC解决稀疏奖励的长期任务,比普通SAC成功率更高,代码已开源。原文稍后读已读值得跟进有用关注 Hierarchical Soft Actor-Critic