主要来源arXiv: Anthropic
查看原文事件专题 · 官方一手
Mythos漏洞复现基准测试:GPT-5.5仅5/18成功
Anthropic在2026年4月发布的Mythos材料中声称其模型能发现真实漏洞,但本文通过控制实验复现了这些漏洞发现任务。实验让GPT-5.5、Claude Opus 4.7和Kimi K2在给定目标文件、只读源码和手动匹配规则下,尝试复现6个已知漏洞。结果显示,GPT-5.5在54次尝试中仅成功5次(覆盖2/6任务),Claude Opus 4.7成功1次,Kimi K2为0次。主要失败原因是模型过早锁定看似合理的候选错误,而忽略了补丁证据中的具体不变性。该结果不否定Anthropic未公开的工作流程,但表明在有利的靶标文件框架下,系统特定提示仅产生少量匹配。
当前结论
这个实验戳破了AI漏洞发现能力的泡沫——即使给定了目标文件,顶级模型复现已知漏洞的成功率也极低。做AI安全评估或漏洞研究的团队,看完会重新审视benchmark的可靠性。
11 个信源58° AI 热度最后更新 2026/5/17 12:24:11
证据链
相关来源 1berryxia
查看原文相关来源 2TestingCatalog
查看原文相关来源 3IT之家
查看原文相关来源 4歸藏(guizang.ai)
查看原文相关来源 5Matt Wolfe
查看原文相关来源 6Geek
查看原文相关来源 7rohanpaul_ai
查看原文相关来源 8岚叔
查看原文相关来源 9向阳乔木
查看原文相关来源 10AI Will
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。