#cunning questions

共 1 条 · 7 天 1 条 · 30 天 1 条
信息流里打上「cunning questions」标签的资讯、产品与论文,按刊登时间排,新的在上。
9月17日
研究提出用含误导前提的数据训练大语言模型提升安全警惕性

朋友,这个研究挺有意思,作者不是直接教模型怎么拒绝有害指令,而是反过来,用一些故意有误导性的问题来训练模型,让它学会“留个心眼”,这样在遇到真正的安全威胁时可能更不容易被绕过。

arXiv cs.AI@Youjia Wang 等 6 人原文