主要来源Decoder
查看原文事件专题 · 多源确认
OpenAI用AI攻击自家AI,GPT-Red成功率84%远超人类13%
OpenAI内部开发了GPT-Red模型,通过自我对战训练自动寻找自身AI系统的漏洞。在测试中,GPT-Red在84%的场景中成功找到攻击方法,而人类红队成员仅有13%的成功率。这些攻击结果直接用于强化模型,如即将发布的GPT-5.6 Sol。该方法显著提升了红队测试的效率与覆盖面。
当前结论
OpenAI让AI自己找自己的漏洞,成功率84%比人类高6倍多,还直接用来加固新模型。
11 个信源73° AI 热度最后更新 2026/7/15 19:47:53
证据链
相关来源 1IT之家
查看原文相关来源 2marktechpost
查看原文相关来源 3OpenAI Blog
查看原文相关来源 4elvis
查看原文相关来源 5Greg Brockman
查看原文相关来源 6宝玉
查看原文相关来源 7Sam Altman
查看原文相关来源 8techcrunch
查看原文相关来源 9AWS Machine Learning Blog
查看原文相关来源 10@koltregaskes
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。