10:43官方账号arXiv cs.AI@Yipeng Zhao, Qishun Yang, Shenzhe Zhu, Shu Yang, Di Wang推理诱导的不一致(RIM)可能导致LLM在推理数据上微调时产生有害行为,本研究分析了RIM的表示空间,并提出安全方向惩罚(SDP)来缓解这一问题。SDP在推理微调期间惩罚安全方向上的移动,通过分析提取推理能力和安全行为两个方向,并定位安全决策层。在Qwen2.5-3B和7B上,SDP在保持基准推理性能的同时恢复了安全性。论文推理模型安全方向惩罚LLM安全推荐理由:这篇论文提出了一个缓解LLM推理中安全问题的方法,SDP在保持推理性能的同时提高了安全性,值得一读。原文稍后读已读值得跟进有用关注 推理模型