事件专题 · 官方一手

DARWIN:通过进化攻防框架实现LLM安全评估与防护

DARWIN是一个开源的进化攻防框架,包含DARWIN-Attack和DARWIN-Guard两部分。DARWIN-Attack通过策略发现、变异和反馈驱动组合,在DeepSeek-V4-Pro和YuFeng-XGuard上实现近100%攻击成功率,在GPT-5.5上超过90%。DARWIN-Guard采用在线对抗训练,在12个安全基准上平均不安全召回率达91.6%,优于YuFeng-XGuard和Nemotron Guard,同时保持近100%的标准良性数据集通过率。该框架将越狱攻击建模为开放进化过程,并持续更新防护措施。

当前结论

论文提出DARWIN,用进化算法同时生成攻击和训练防护,在DeepSeek-V4-Pro和GPT-5.5上攻击成功率超高,安全召回率也强。

2 个信源35° AI 热度最后更新 2026/7/22 07:08:59

证据链

相关来源 1Simon Willison’s Weblog
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情