论文Agent 与开发者精选09:21研究提出用含误导前提的数据训练大语言模型提升安全警惕性朋友,这个研究挺有意思,作者不是直接教模型怎么拒绝有害指令,而是反过来,用一些故意有误导性的问题来训练模型,让它学会“留个心眼”,这样在遇到真正的安全威胁时可能更不容易被绕过。#cunning questions#安全对齐#大语言模型aarXiv cs.AI@Youjia Wang 等 6 人原文稍后读已读值得跟进有用关注 cunning questions