论文政策与合规10:12仅需0.1%-1%token:IER改进稀疏在线蒸馏的梯度估计蒸馏最烧token,这篇把教师监督压到0.1%-1%还不掉点,reverse-KL目标也保留,做训练的可以直接抄代码。#模型蒸馏#IER#token选择#reverse-KLaarXiv cs.LG@Huanxin Sheng 等 6 人原文稍后读已读值得跟进有用关注 模型蒸馏
模型11:42即时回合重复提升强化学习样本效率这篇论文提出了一种简单却有效的IER机制,能让强化学习智能体通过重复成功动作更快学习。#强化学习#IER#SAC#TD3aarXiv: Google DeepMind@Hoda Yamani 等 5 人原文稍后读已读值得跟进有用关注 强化学习