12:37官方账号arXiv cs.LG@Xian Sun, Wei Chow, Yingshuo Wang, Junhao Liu, Wei Gao, Qing Wu, Lingdong Kong论文提出MIST基准,将每道推理题置于干净、误导、正确上下文、无关上下文四种条件下。配套SC2W指标衡量误导信号使原本正确答案变错的频率。作者发现该脆弱性在多种开源模型上普遍存在。提出的SCOPE方法通过匹配偏好对优化DPO目标,在保持干净上下文准确率的同时显著降低SC2W。论文MISTSC2WSCOPE推荐理由:这篇论文把“信不信上下文”当成独立问题来训练,用MIST测出模型容易被一条错误信息带偏,SCOPE能减少这种翻车还不影响正常表现。原文稍后读已读值得跟进有用关注 MIST