10:11官方账号arXiv cs.LG@Tomáš Holeček, Viliam Lisý精选73°NashDreamer是一种基于模型的强化学习框架,专为双人零和博弈设计。该框架引入了多智能体循环状态空间模型(MARSSM),在四个基准游戏中显著提升了早期训练的样本效率。研究还分析了Dreamer算法族在随机环境中面临的后验崩溃问题。论文NashDreamer强化学习零和博弈推荐理由:斯坦福团队推出NashDreamer,解决零和博弈中的非平稳性问题,比无模型基线训练效率更高。原文稍后读已读值得跟进有用关注 NashDreamer