事件专题 · 官方一手

OpenAI 详解 GPT-Red:自动红队模型以84%胜率击败人类

OpenAI 训练了内部自动红队模型 GPT-Red,采用自我对弈强化学习对抗防御模型。在间接提示注入基准测试中,GPT-Red 以 84% 对 13% 的胜率击败人类红队。它还发现了一种新型攻击类别 "Fake Chain-of-Thought"。在 OpenAI 最难的直接注入基准上,GPT-Red 将 GPT-5.6 Sol 的失败次数减少了 6 倍。不过,OpenAI 承认该模型在多轮对话和基于图像的攻击方面仍有不足。

当前结论

OpenAI 搞了个 GPT-Red 自动红队模型,提示注入赢人类 84% 对 13%,还发现了 Fake Chain-of-Thought 攻击。

11 个信源77° AI 热度最后更新 2026/7/16 18:48:04

证据链

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情