8月11日
11:48
11:48官方账号arXiv cs.AI@Wanying Qu, Qinghua Mao, Yu Li, Jiyao Liu, Xin Zhang, Dadi Guo, Yanxu Zhu, Qingyu Liu, Leitao Yuan, Xi Lin, Shanfeng Zhu, Yanwei Fu, Jing Shao, Xia Hu, Dongrui Liu
SHE框架将智能体安全机制分解为系统提示、规则库、安全记忆和工具策略四个组件,每个组件有明确的安全职责。该框架通过归因引导的进化循环,将轨迹失败转化为结构化诊断,并学习组件特定的边界优化。在Agent-SafetyBench上,SHE相比静态SafeHarness将攻击成功率降低3.1倍,同时提升良性效用。进化后的安全机制在AgentHarm基准上泛化到未见风险,并无需额外进化即可跨智能体模型迁移。
推荐理由:SHE把智能体安全从模型权重扩展到运行框架,分解成四个可独立进化的组件,实测攻击成功率降3.1倍,还能跨模型迁移,搞AI安全的值得看看。