gptred·general

GPT-Red

别名
首次出现
2026-07-15
最近出现
2026-07-16
累计提及
17
§ 01综述

GPT-Red 是 OpenAI 于 2025 年初推出的一套自动化红队测试系统,它利用 AI 代理模拟攻击者的手段,对自家大语言模型进行对抗性测试,以发现并修补安全漏洞,相当于用 AI 来攻击 AI。

GPT-Red 近期进展

2025 年 2 月,OpenAI 在 X 平台上正式发布 GPT-Red,并披露其自动化攻击的成功率达到 84%,远超人类红队专家 13% 的平均水平。该系统通过生成对抗性输入,集中测试模型对提示注入、越狱攻击等威胁的防御能力。

基于 GPT-Red 的发现,OpenAI 推出了 GPT-5.6 Sol 版本。据官方数据,该版本对抗提示注入攻击的失败率相比前代降低了 6 倍,安全对齐得到显著改进。训练过程采用了自我对弈机制,即 GPT-Red 不断生成更复杂的攻击,促使模型迭代升级。

OpenAI 联合创始人 Greg Brockman 在 X 上强调,GPT-Red 的自动化流程已大幅降低了对人类红队的依赖,能够持续、大规模地验证模型安全性,并计划将其开源或作为服务提供给开发者社区。

当前焦点与观察点

GPT-Red 的核心争议在于其“用 AI 评估 AI”的可靠性:系统可能陷入“攻击盲区”,即只擅长寻找它自身被训练去发现的漏洞,而遗漏人类直觉可识别的其他风险。此外,84% 的成功率是基于其预设的攻击方式,与真实世界的多样性攻击仍存在差距。尽管 GPT-Red 显著提升了对抗训练效率,但过度自动化可能削弱人类对安全伦理的最终判断。目前业界正关注 OpenAI 如何平衡自动化测试与人工审查的结合,以及这套系统能否有效推广到第三方模型评测中。

§ 02相关报道09 条在档
  1. 01
    OpenAI 详解 GPT-Red:自动红队模型以84%胜率击败人类
    marktechpost
  2. 02
    OpenAI发布内部网安红队模型GPT-Red,自动化攻击模拟提升鲁棒性
    IT之家
  3. 03
    OpenAI用AI攻击自家AI,GPT-Red成功率84%远超人类13%
    Decoder
  4. 04
    GPT-Red:通过自动化红队测试提升模型安全性
    Greg Brockman
  5. 05
    GPT-Red 通过对抗训练提升 GPT-5.6 的提示注入防御能力
    elvis
  6. 06
    OpenAI用AI agent改进下一代模型安全对齐
    OpenAI
  7. 07
    OpenAI 发布 GPT-5.6 Sol,对抗 prompt 注入失败率降低 6 倍
    OpenAI
  8. 08
    OpenAI 推出 GPT-Red 自动化红队测试系统
    OpenAI
  9. 09
    GPT-Red:利用自我对弈提升AI鲁棒性
    OpenAI Blog
§ 03邻近话题

本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

/topic/GPT-Red