12:08官方账号arXiv cs.AI@Joshua Fonseca Rivera, Neil Shah, David Demitri Africa, Konstantinos Voudouris一项研究将项目反应理论(IRT)应用于8个安全基准、192个语言模型,这是迄今最大规模的LLM安全评估心理测量分析。研究发现,拒绝严格度、真实性和情境危害三个可解释因子解释了模型间大部分差异。IRT选出的题目在恢复完整基准分数时误差低于随机子集,约10个自适应题即可替代若干单个基准,评估成本降低97%-99%。IRT还能用于检测模型的朴素沙袋行为和API后端模型更换。论文项目反应理论AI安全安全基准推荐理由:这篇论文用IRT给192个模型的安全基准做心理测量,能把评测成本砍掉97%以上,还能识破模型故意考差或API后门换模型。原文稍后读已读值得跟进有用关注 项目反应理论