15:42官方账号arXiv cs.AI@Saisab Sadhu, Aadit Sengupta, Vinay Kumar Sankarapu, Pratinav SetharXiv 论文《What Do Compliance Detectors Read?》审计了激活探针和防护模型,发现它们存在规则盲区:删除、置换或替换规则文本不影响检测准确率。作者构建了双规则双场景的交叉基准,证实了该失效,并指出逐步推理是唯一能摆脱规则盲区的方法。论文提出无训练激活读数 ICS,但其泛化性能与词袋模型相当,且易受白盒攻击。研究发布了反事实协议和交叉规则基准,供未来检测器测试使用。论文合规检测规则盲区激活探针推荐理由:这篇论文把合规检测器的底裤扒了:换掉规则文本,检测结果居然不变。想搞懂 AI 合规监控靠不靠谱,看这篇就对了。原文稍后读已读值得跟进有用关注 合规检测