AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

安全基准

共 3 条相关 AI 资讯
8月6日
12:08
12:08官方账号arXiv cs.AI@Joshua Fonseca Rivera, Neil Shah, David Demitri Africa, Konstantinos Voudouris
一项研究将项目反应理论(IRT)应用于8个安全基准、192个语言模型,这是迄今最大规模的LLM安全评估心理测量分析。研究发现,拒绝严格度、真实性和情境危害三个可解释因子解释了模型间大部分差异。IRT选出的题目在恢复完整基准分数时误差低于随机子集,约10个自适应题即可替代若干单个基准,评估成本降低97%-99%。IRT还能用于检测模型的朴素沙袋行为和API后端模型更换。
论文项目反应理论AI安全安全基准

推荐理由:这篇论文用IRT给192个模型的安全基准做心理测量,能把评测成本砍掉97%以上,还能识破模型故意考差或API后门换模型。
原文
6月12日
09:12
09:12官方账号arXiv cs.AI@Zihao Wang, Yiming Li, Yutong Wu, Zheyu Liu, Kangjie Chen, Fok Kar Wai, Pin-Yu Chen, Vrizlynn L. L. Thing, Bo Li, Dacheng Tao, Tianwei Zhang
StakeBench 是一个新的安全基准,用于评估 LLM 驱动的 Web 智能体在面对提示注入攻击时的风险。与现有仅关注攻击可行性的基准不同,StakeBench 采用利益相关者中心视角,区分攻击对用户、卖家、平台等不同实体的影响。研究发现,当前智能体无法可靠抵御任何攻击目标,且失败模式多样,包括“隐蔽寄生”(攻击成功但不干扰用户任务)、“错位破坏”(任务中断但攻击失败)和“复合失败”(攻击和任务均失败)。该基准揭示了传统评估忽略的漏洞分布,强调了在真实部署中需要利益相关者感知的评估。代码已开源。
论文提示注入Web智能体安全基准

推荐理由:做 Web 智能体安全评估的团队会发现 StakeBench 补上了现有基准的盲区——它不只看攻击是否成功,还看谁承担了后果,建议安全研究人员和智能体开发者点开看看。
原文
5月28日
11:36
11:36官方一手arXiv: OpenAI@Aman Priyanshu, Supriti Vijay, Esha Pahwa
精选72°
该研究引入了一个模拟平台,让数千个LLM智能体在社区中互动一个月,评估隐私泄露风险。研究发现,从单轮转向多轮社交评估时,隐私泄露率从19.95%升至45.30%(OpenAI模型)。观察同伴泄露后,智能体泄露敏感信息的概率增加8倍。即使有明确的隐私指令,泄露率仍高于37.8%。这表明静态聊天基准测试低估了智能体部署中的隐私风险,社交环境本身就能引发单轮评估无法发现的敏感信息泄露。
论文隐私安全多智能体系统LLM评估

推荐理由:多智能体系统正在走向真实部署,但隐私风险被严重低估——做AI安全评估或部署智能体应用的团队,建议看看这个研究,它揭示了社交环境如何放大隐私泄露。
原文
精选全部日报登录