事件专题 · 多源确认

OpenAI发布内部网安红队模型GPT-Red,自动化攻击模拟提升鲁棒性

OpenAI介绍了内部使用的网络安全红队模型GPT-Red。该模型通过自博弈强化学习训练,可自动化模拟网络攻击。自GPT-5.3后的每个生产模型均使用GPT-Red进行训练。伪造思维链攻击成功率从GPT-5.1的95%降低至最新模型不足10%,最新GPT-5.6 Sol在直接提示符注入攻击中失败率仅0.05%。

当前结论

OpenAI搞了个内部红队模型GPT-Red,自动找漏洞,攻击成功率从95%降到10%以下,效果很实在。

11 个信源63° AI 热度最后更新 2026/7/16 03:38:08

证据链

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情