02:53官方一手marktechpost@Asif Razzaq77°OpenAI 训练了内部自动红队模型 GPT-Red,采用自我对弈强化学习对抗防御模型。在间接提示注入基准测试中,GPT-Red 以 84% 对 13% 的胜率击败人类红队。它还发现了一种新型攻击类别 "Fake Chain-of-Thought"。在 OpenAI 最难的直接注入基准上,GPT-Red 将 GPT-5.6 Sol 的失败次数减少了 6 倍。不过,OpenAI 承认该模型在多轮对话和基于图像的攻击方面仍有不足。AI模型GPT-RedOpenAIGPT-5.6 Sol10 个信源在谈事件专题推荐理由:OpenAI 搞了个 GPT-Red 自动红队模型,提示注入赢人类 84% 对 13%,还发现了 Fake Chain-of-Thought 攻击。原文稍后读已读值得跟进有用关注 GPT-Red
11:39IT之家(博客/媒体)精选OpenAI介绍了内部使用的网络安全红队模型GPT-Red。该模型通过自博弈强化学习训练,可自动化模拟网络攻击。自GPT-5.3后的每个生产模型均使用GPT-Red进行训练。伪造思维链攻击成功率从GPT-5.1的95%降低至最新模型不足10%,最新GPT-5.6 Sol在直接提示符注入攻击中失败率仅0.05%。AI模型GPT-RedOpenAIGPT-5.310 个信源在谈事件专题推荐理由:OpenAI搞了个内部红队模型GPT-Red,自动找漏洞,攻击成功率从95%降到10%以下,效果很实在。原文稍后读已读值得跟进有用关注 GPT-Red
04:20官方账号Decoder@Matthias Bastian73°OpenAI内部开发了GPT-Red模型,通过自我对战训练自动寻找自身AI系统的漏洞。在测试中,GPT-Red在84%的场景中成功找到攻击方法,而人类红队成员仅有13%的成功率。这些攻击结果直接用于强化模型,如即将发布的GPT-5.6 Sol。该方法显著提升了红队测试的效率与覆盖面。AI模型OpenAIGPT-RedGPT-5.6 Sol10 个信源在谈事件专题推荐理由:OpenAI让AI自己找自己的漏洞,成功率84%比人类高6倍多,还直接用来加固新模型。原文稍后读已读值得跟进有用关注 OpenAI
03:54官方账号Greg Brockman@gdb精选73°OpenAI发布GPT-Red,一种内部自动化红队测试工具,专注于大规模发现模型的提示注入漏洞。该工具帮助OpenAI在模型广泛部署前建立更强防御。GPT-Red通过模拟攻击自动检测提示注入风险,提升模型安全性。OpenAI利用该工具在正式发布前修复漏洞,降低安全威胁。AI模型OpenAIGPT-Red提示注入10 个信源在谈事件专题推荐理由:OpenAI搞了个自动红队GPT-Red,专门找自家模型的提示注入漏洞,部署前先修好,安全又可靠。原文稍后读已读值得跟进有用关注 OpenAI
02:56elvis@omarsar073°OpenAI 发布了内部自动化红队工具 GPT-Red,用于大规模发现模型中的提示注入漏洞。GPT-Red 对 GPT-5.6 进行了对抗性训练,显著增强了其对抗提示注入的鲁棒性。该方法以高投资回报率提升了 AI 模型的安全性,帮助在更广泛部署前构建更强防御。AI模型GPT-RedGPT-5.6OpenAI10 个信源在谈事件专题推荐理由:OpenAI 用 GPT-Red 对抗训练 GPT-5.6,让模型更抗提示注入,安全提升很实在。原文稍后读已读值得跟进有用关注 GPT-Red
02:26官方账号OpenAI@OpenAI (@OpenAI)73°OpenAI 发布内部自动化红队测试系统 GPT-Red,旨在大规模发现其模型的提示注入漏洞。该工具通过自动化攻击模拟,帮助 OpenAI 在模型更广泛部署前识别并修复安全缺陷。GPT-Red 是 OpenAI 提升 AI 模型防御能力的关键举措,专注于提示注入这一常见攻击向量。AI产品OpenAIGPT-Redprompt injection10 个信源在谈事件专题推荐理由:OpenAI 造了个自动找提示注入漏洞的工具 GPT-Red,能大规模测试模型安全,帮你提前堵漏洞。原文稍后读已读值得跟进有用关注 OpenAI
02:25官方账号OpenAI@OpenAI (@OpenAI)精选OpenAI 通过对抗训练(对抗 GPT-Red)提升了 GPT-5.6 的安全性。测试中重放了 GPT-Red 的最强攻击(均未在训练中出现),GPT-5.6 Sol 成为最鲁棒的模型。与四个月前的最佳生产模型相比,失败次数减少至 6 倍。该结果表明对抗训练可显著增强 LLM 对 prompt 注入的防御能力。AI模型GPT-5.6GPT-RedOpenAI10 个信源在谈事件专题推荐理由:OpenAI 刚晒出 GPT-5.6 Sol,抗 prompt 注入比四个月前强了 6 倍,安全能力大幅提升。原文稍后读已读值得跟进有用关注 GPT-5.6
02:24官方账号OpenAI@OpenAI (@OpenAI)OpenAI宣布正在使用AI agent来增强下一代模型的能力。通过GPT-Red项目,他们解锁了安全方面的飞轮效应,让今日的模型能够帮助明日的模型变得更鲁棒、对齐和可信。AI模型OpenAIGPT-RedAI agent10 个信源在谈事件专题推荐理由:OpenAI说他们用AI agent让模型自己变安全了,通过GPT-Red项目,下一代模型会更可靠。原文稍后读已读值得跟进有用关注 OpenAI
01:14官方一手OpenAI Blog(博客/媒体)OpenAI发布了GPT-Red,一个自动化红队测试系统。该系统采用自我对弈机制,让大模型相互对抗生成测试用例,以提升对提示注入等攻击的鲁棒性。GPT-Red旨在通过自动化的对抗训练,持续改进AI模型的安全性和对齐性。AI产品GPT-RedOpenAIAI安全10 个信源在谈事件专题推荐理由:OpenAI搞了个新系统叫GPT-Red,让模型自己打自己来找出漏洞,专门防提示注入这类攻击,挺实用的。原文稍后读已读值得跟进有用关注 GPT-Red