论文精选72°13:26Negation Neglect:微调让模型把假新闻当真,安全风险凸显这个发现戳穿了微调中“加否定声明就能纠正模型”的幻觉,做安全对齐或数据清洗的团队必须警惕——你的训练数据里那些“假新闻”可能正在反向教坏模型。建议所有做微调的人点开看看,避免踩坑。#否定忽视#微调#AI安全#假信息aarXiv cs.LG@Harry Mayne 等 6 人原文稍后读已读值得跟进有用关注 否定忽视