11:11官方账号arXiv cs.AI@Zhijie Zheng, Yu Li, Chen Qian, Yuqian Fu, Yanwei Fu, Lu Sheng, Jing Shao, Dongrui LiuStepGuard 是一种级联防护模型,可审计代理轨迹并检查执行前的工具操作。使用 StepGen 生成安全和不安全的轨迹进行训练,Balance-GRPO 动态平衡安全与不安全操作的学习。实验表明,StepGuard 在开放权重防护模型中实现最高平均准确率,与 GPT-5.4 性能相当。在 AgentDojo 和 AgentDyn 上使用 StepGuard,相对于无防护设置,平均攻击成功率降低 77.3%,而平均效用仅下降 2.8 个百分点。论文StepGuard安全防护级联防护推荐理由:StepGuard 通过自动数据生成和动态平衡学习,显著提高了安全防护的准确率,同时保持了效用。与 GPT-5.4 相比,防护效果更佳,值得一看。原文稍后读已读值得跟进有用关注 StepGuard