09:35官方账号arXiv cs.LG@Yongjian Guo, Wanlun Ma, Lingyu Shen, Xi Xiao, Sheng WenROPD通过建模对齐与受损输出概率分布之间的差异,而非拟合特定提示模板,来防御恶意微调攻击。实验在三个数据集(AlpacaEval、SafetyEval、MMLU)和三个基础模型(Llama-2-7B、Mistral-7B、Vicuna-7B)上与四个基线方法(DPO、PPO、GARLIC、SALMON)对比。结果显示基线方法在模板不匹配时下游任务性能严重下降,而ROPD显著缓解模板不匹配风险,防御效果和能力保留均保持强鲁棒性。ROPD虽非完全免疫模板变化,但性能下降远小于现有方法,为LLM安全再对齐设立新标准。论文ROPDLLM安全微调推荐理由:这篇论文提出ROPD,能有效防止微调时被植入有害行为,同时不牺牲专业能力,比现有方法更能抵抗模板攻击。原文稍后读已读值得跟进有用关注 ROPD