AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

心理测量

共 1 条相关 AI 资讯
8月6日
12:08
12:08官方账号arXiv cs.AI@Joshua Fonseca Rivera, Neil Shah, David Demitri Africa, Konstantinos Voudouris
一项研究将项目反应理论(IRT)应用于8个安全基准、192个语言模型,这是迄今最大规模的LLM安全评估心理测量分析。研究发现,拒绝严格度、真实性和情境危害三个可解释因子解释了模型间大部分差异。IRT选出的题目在恢复完整基准分数时误差低于随机子集,约10个自适应题即可替代若干单个基准,评估成本降低97%-99%。IRT还能用于检测模型的朴素沙袋行为和API后端模型更换。
论文项目反应理论AI安全安全基准

推荐理由:这篇论文用IRT给192个模型的安全基准做心理测量,能把评测成本砍掉97%以上,还能识破模型故意考差或API后门换模型。
原文
精选全部日报登录