15:13官方账号Decoder@Jonathan Kemper精选英国AI安全研究所研究人员使用心理测量法表明,流行的语言模型安全基准未能衡量一个一致的特性。全面阻止请求可以人为地提高安全评分,即使模型在日常使用中变得越来越不实用。该研究还提供了一种方法来捕捉在测试中比正常使用时更加谨慎的模型。论文AI安全心理测量法语言模型推荐理由:英国AI安全研究所用心理测量法揭示了AI安全测试的缺陷,值得一读。原文稍后读已读值得跟进有用关注 AI安全