事件专题 ·官方一手

Self-Evolving Defense:LLM智能体安全框架

研究人员提出Self-Evolving Defense (SED)框架,无需重新训练模型即可持续学习安全策略。该框架在DeepSeek V4 Flash、GLM 5.2和Kimi K3三个开源模型上测试,在AGENTDOJO基准上将目标提示注入成功率降至0.42%,而最佳基线防御为3.7%。在HARMBENCH基准上,SED将X-TEAMING攻击成功率控制在7.8%,远低于最佳基线的35.2%,同时保持良性任务效用。

当前结论

SED框架让LLM智能体无需重训练就能持续防御新型攻击,在DeepSeek、GLM和Kimi模型上都表现出色。

6 个信源63° AI 热度最后更新 2026/9/29 03:19:11

证据链

6 个信源
相关来源 5Aravind Srinivas
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。