论文10:16HySTAR:用锚定超图改进多智能体强化学习的信用分配做 MARL 的可以看看这篇,用固定超图解决信用分配漂移,SMAC 上比 MAPPO 提了 16.7%,实验覆盖挺全。#HySTAR#MAPPO#多智能体强化学习#SMACaarXiv cs.LG@Xinglong Luo 等 8 人原文稍后读已读值得跟进有用关注 HySTAR
论文10:03G2MAF:测试时梯度引导优化多智能体流策略多智能体离线RL的新做法:部署后不用重训,靠critic梯度在测试时微调动作,MPE和SMAC上平均提升约9%,延迟只多6%。#G2MAF#多智能体#强化学习#SMACaarXiv cs.AI@Guowei Zou 等 7 人原文稍后读已读值得跟进有用关注 G2MAF