GPT-Red 是 OpenAI 于 2025 年初推出的一套自动化红队测试系统,它利用 AI 代理模拟攻击者的手段,对自家大语言模型进行对抗性测试,以发现并修补安全漏洞,相当于用 AI 来攻击 AI。
GPT-Red 近期进展
2025 年 2 月,OpenAI 在 X 平台上正式发布 GPT-Red,并披露其自动化攻击的成功率达到 84%,远超人类红队专家 13% 的平均水平。该系统通过生成对抗性输入,集中测试模型对提示注入、越狱攻击等威胁的防御能力。
基于 GPT-Red 的发现,OpenAI 推出了 GPT-5.6 Sol 版本。据官方数据,该版本对抗提示注入攻击的失败率相比前代降低了 6 倍,安全对齐得到显著改进。训练过程采用了自我对弈机制,即 GPT-Red 不断生成更复杂的攻击,促使模型迭代升级。
OpenAI 联合创始人 Greg Brockman 在 X 上强调,GPT-Red 的自动化流程已大幅降低了对人类红队的依赖,能够持续、大规模地验证模型安全性,并计划将其开源或作为服务提供给开发者社区。
当前焦点与观察点
GPT-Red 的核心争议在于其“用 AI 评估 AI”的可靠性:系统可能陷入“攻击盲区”,即只擅长寻找它自身被训练去发现的漏洞,而遗漏人类直觉可识别的其他风险。此外,84% 的成功率是基于其预设的攻击方式,与真实世界的多样性攻击仍存在差距。尽管 GPT-Red 显著提升了对抗训练效率,但过度自动化可能削弱人类对安全伦理的最终判断。目前业界正关注 OpenAI 如何平衡自动化测试与人工审查的结合,以及这套系统能否有效推广到第三方模型评测中。