论文13:19混合架构 LM 过度依赖注意力,辅助损失可改善记忆利用训练混合架构模型的朋友看看这篇:加了限制注意力访问历史的辅助损失后,长上下文任务提升明显,方法可直接套用。#循环-注意力混合模型#辅助损失#长上下文#问答aarXiv cs.AI@Hyunji Lee 等 8 人原文稍后读已读值得跟进有用关注 循环-注意力混合模型