事件专题 ·多源确认

GLM-5.3 网络安全能力接近 Claude Mythos:ExploitBench 得分 12% vs 14%

Andrew Ng 在本周信件中引用 Anthropic 的评测数据:开源模型 GLM-5.3 在 ExploitBench 漏洞利用任务中解决 12%,闭源的 Claude Mythos 为 14%,差距很小。测试中仅花费 20.40 美元的 token 就复现了 Google Chrome 近期的一个安全漏洞。对于开源模型带来攻击能力扩散的担忧,Andrew Ng 的观点不同:他认为这是一个工程问题,防御方在长期博弈中占据优势。

当前结论

开源的 GLM-5.3 网络攻防能力快追上 Claude Mythos 了,20 美元 token 就能挖出 Chrome 漏洞,Andrew Ng 还给出了防御方的判断。

11 个信源43° AI 热度最后更新 2026/10/4 02:59:59

证据链

11 个信源
相关来源 3Clement Delangue
查看原文
相关来源 5AWS Machine Learning Blog
查看原文
相关来源 10The Information
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。