AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

模板鲁棒性

共 1 条相关 AI 资讯
7月30日
09:35
09:35官方账号arXiv cs.LG@Yongjian Guo, Wanlun Ma, Lingyu Shen, Xi Xiao, Sheng Wen
ROPD通过建模对齐与受损输出概率分布之间的差异,而非拟合特定提示模板,来防御恶意微调攻击。实验在三个数据集(AlpacaEval、SafetyEval、MMLU)和三个基础模型(Llama-2-7B、Mistral-7B、Vicuna-7B)上与四个基线方法(DPO、PPO、GARLIC、SALMON)对比。结果显示基线方法在模板不匹配时下游任务性能严重下降,而ROPD显著缓解模板不匹配风险,防御效果和能力保留均保持强鲁棒性。ROPD虽非完全免疫模板变化,但性能下降远小于现有方法,为LLM安全再对齐设立新标准。
论文ROPDLLM安全微调

推荐理由:这篇论文提出ROPD,能有效防止微调时被植入有害行为,同时不牺牲专业能力,比现有方法更能抵抗模板攻击。
原文
精选全部日报登录