AdvSim2Real:在Web世界模型中同时训练任务、注入攻击与智能体
页面上的恶意提示能劫持浏览器智能体,这篇论文让任务、攻击和智能体在模拟器里互相对抗着变强,4B 小模型对未见攻击完成率提升 33.6%。
页面上的恶意提示能劫持浏览器智能体,这篇论文让任务、攻击和智能体在模拟器里互相对抗着变强,4B 小模型对未见攻击完成率提升 33.6%。
做 Web 智能体安全评估的团队会发现 StakeBench 补上了现有基准的盲区——它不只看攻击是否成功,还看谁承担了后果,建议安全研究人员和智能体开发者点开看看。