主要来源marktechpost
查看原文事件专题 · 官方一手
OpenAI 详解 GPT-Red:自动红队模型以84%胜率击败人类
OpenAI 训练了内部自动红队模型 GPT-Red,采用自我对弈强化学习对抗防御模型。在间接提示注入基准测试中,GPT-Red 以 84% 对 13% 的胜率击败人类红队。它还发现了一种新型攻击类别 "Fake Chain-of-Thought"。在 OpenAI 最难的直接注入基准上,GPT-Red 将 GPT-5.6 Sol 的失败次数减少了 6 倍。不过,OpenAI 承认该模型在多轮对话和基于图像的攻击方面仍有不足。
当前结论
OpenAI 搞了个 GPT-Red 自动红队模型,提示注入赢人类 84% 对 13%,还发现了 Fake Chain-of-Thought 攻击。
11 个信源77° AI 热度最后更新 2026/7/16 18:48:04
证据链
相关来源 1Greg Brockman
查看原文相关来源 2Decoder
查看原文相关来源 3IT之家
查看原文相关来源 4OpenAI Blog
查看原文相关来源 5elvis
查看原文相关来源 6Sam Altman
查看原文相关来源 7@OpenAIDevs
查看原文相关来源 8arXiv: OpenAI
查看原文相关来源 9shao__meng
查看原文相关来源 10Suhail
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。