10:15官方账号arXiv cs.AI@Kehan Wang论文提出Role-Decoupled Attention Residuals(RD-AttnRes),将查询/键与值的深度路由分开。在FineWeb-Edu上用五组种子训练120M和343M参数模型,各用2.0B token预算。RD-AttnRes在全部10项对比中降低验证负对数似然,120M和343M平均降幅分别为0.0301和0.0247,困惑度降低2.97%和2.43%。早期预算对照排除参数数、重复路由执行和固定值路由的干扰。路由诊断显示查询-键与值的深度分布持续分离。论文RD-AttnRes注意力残差深度路由推荐理由:只给值路由多加一条独立通道,120M/343M模型10组对照全胜,困惑度降2-3%。做Transformer的可以看看。原文稍后读已读值得跟进有用关注 RD-AttnRes