论文10:22对抗性语用学用于AI安全评估:指令冲突、嵌入命令与策略歧义基准这篇论文搞了一个对抗性语用学基准,有18个具体条目,专门测试模型被指令冲突、嵌入命令搞昏头的情况,比以前只打通过/不通过标签靠谱多了。#对抗性语用学#AI安全#基准#指令冲突aarXiv cs.AI@Brett Reynolds原文稍后读已读值得跟进有用关注 对抗性语用学