论文10:03G2MAF:测试时梯度引导优化多智能体流策略多智能体离线RL的新做法:部署后不用重训,靠critic梯度在测试时微调动作,MPE和SMAC上平均提升约9%,延迟只多6%。#G2MAF#多智能体#强化学习#SMACaarXiv cs.AI@Guowei Zou 等 7 人原文稍后读已读值得跟进有用关注 G2MAF