事件专题 · 多源确认

OpenAI用AI攻击自家AI,GPT-Red成功率84%远超人类13%

OpenAI内部开发了GPT-Red模型,通过自我对战训练自动寻找自身AI系统的漏洞。在测试中,GPT-Red在84%的场景中成功找到攻击方法,而人类红队成员仅有13%的成功率。这些攻击结果直接用于强化模型,如即将发布的GPT-5.6 Sol。该方法显著提升了红队测试的效率与覆盖面。

当前结论

OpenAI让AI自己找自己的漏洞,成功率84%比人类高6倍多,还直接用来加固新模型。

11 个信源73° AI 热度最后更新 2026/7/15 19:47:53

证据链

相关来源 9AWS Machine Learning Blog
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情