主要来源IT之家
查看原文事件专题 · 多源确认
OpenAI发布内部网安红队模型GPT-Red,自动化攻击模拟提升鲁棒性
OpenAI介绍了内部使用的网络安全红队模型GPT-Red。该模型通过自博弈强化学习训练,可自动化模拟网络攻击。自GPT-5.3后的每个生产模型均使用GPT-Red进行训练。伪造思维链攻击成功率从GPT-5.1的95%降低至最新模型不足10%,最新GPT-5.6 Sol在直接提示符注入攻击中失败率仅0.05%。
当前结论
OpenAI搞了个内部红队模型GPT-Red,自动找漏洞,攻击成功率从95%降到10%以下,效果很实在。
11 个信源63° AI 热度最后更新 2026/7/16 03:38:08
证据链
相关来源 1Decoder
查看原文相关来源 2marktechpost
查看原文相关来源 3elvis
查看原文相关来源 4OpenAI Blog
查看原文相关来源 5Greg Brockman
查看原文相关来源 6Sam Altman
查看原文相关来源 7@koltregaskes
查看原文相关来源 8berryxia
查看原文相关来源 9AI Will
查看原文相关来源 10@OpenAIDevs
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。