02:57官方账号OpenAI@OpenAI83°OpenAI 暂停了针对部署的最新模型的强化学习训练两周。团队在此期间加固了研究环境并进行了红队测试,同时扩大了监控覆盖范围。目前最大规模的前沿 RL 运行仍处于暂停状态。小规模训练和评估正在运行以验证这些安全措施并建立对齐证据。行业OpenAI强化学习红队测试10 个信源在谈事件专题推荐理由:OpenAI 暂停前沿模型 RL 训练两周,先搞红队测试和加固环境。原文稍后读已读值得跟进有用关注 OpenAI
18:00官方一手Anthropic: Research(资讯)Anthropic前沿红队于2026年8月13日发布新兴多智能体系统研究报告。报告基于红队测试实战经验,梳理了多智能体协作中反复出现的模式与问题。研究覆盖Agent协同中的交互规律、典型失败场景与安全风险,为多智能体系统的开发与部署提供了系统性参考。论文Anthropic多智能体AI安全10 个信源在谈事件专题推荐理由:Anthropic红队把多智能体系统的常见坑都整理出来了,搞Agent开发和安全的人能少踩雷。原文稍后读已读值得跟进有用关注 Anthropic
09:07官方账号Simon Willison@simonw推文作者Simon Willison呼吁OpenAI公布一个测试任务的具体细节,该任务指定给他们的“rogue agent”(恶意代理)。据猜测,这个代理被给予了完整的ExploitGym套件并指示解决任务,同时允许在练习中运行5.6-Sol子代理。这表明OpenAI正在对其AI系统的安全性进行内部红队评估,但官方未公开完整信息。行业OpenAI安全测试ExploitGym10 个信源在谈事件专题推荐理由:OpenAI内部红队测试细节可能透露AI安全新进展,推文提到ExploitGym和5.6-Sol子代理原文稍后读已读值得跟进有用关注 OpenAI
03:12官方一手Anthropic: Research(资讯)Anthropic的Frontier Red Team使用Claude找到了多个密码学实现中的安全弱点。该团队通过Claude分析了常见加密协议的逻辑与实现细节。结果表明Claude能发现传统工具难以察觉的漏洞。论文ClaudeAnthropic密码学10 个信源在谈事件专题推荐理由:Anthropic的红队用Claude找出了密码学实现里的漏洞,比传统静态分析工具更聪明,值得看他们的方法。原文稍后读已读值得跟进有用关注 Claude
02:53官方一手marktechpost@Asif Razzaq77°OpenAI 训练了内部自动红队模型 GPT-Red,采用自我对弈强化学习对抗防御模型。在间接提示注入基准测试中,GPT-Red 以 84% 对 13% 的胜率击败人类红队。它还发现了一种新型攻击类别 "Fake Chain-of-Thought"。在 OpenAI 最难的直接注入基准上,GPT-Red 将 GPT-5.6 Sol 的失败次数减少了 6 倍。不过,OpenAI 承认该模型在多轮对话和基于图像的攻击方面仍有不足。AI模型GPT-RedOpenAIGPT-5.6 Sol10 个信源在谈事件专题推荐理由:OpenAI 搞了个 GPT-Red 自动红队模型,提示注入赢人类 84% 对 13%,还发现了 Fake Chain-of-Thought 攻击。原文稍后读已读值得跟进有用关注 GPT-Red
04:20官方账号Decoder@Matthias Bastian73°OpenAI内部开发了GPT-Red模型,通过自我对战训练自动寻找自身AI系统的漏洞。在测试中,GPT-Red在84%的场景中成功找到攻击方法,而人类红队成员仅有13%的成功率。这些攻击结果直接用于强化模型,如即将发布的GPT-5.6 Sol。该方法显著提升了红队测试的效率与覆盖面。AI模型OpenAIGPT-RedGPT-5.6 Sol10 个信源在谈事件专题推荐理由:OpenAI让AI自己找自己的漏洞,成功率84%比人类高6倍多,还直接用来加固新模型。原文稍后读已读值得跟进有用关注 OpenAI
03:54官方账号Greg Brockman@gdb精选73°OpenAI发布GPT-Red,一种内部自动化红队测试工具,专注于大规模发现模型的提示注入漏洞。该工具帮助OpenAI在模型广泛部署前建立更强防御。GPT-Red通过模拟攻击自动检测提示注入风险,提升模型安全性。OpenAI利用该工具在正式发布前修复漏洞,降低安全威胁。AI模型OpenAIGPT-Red提示注入10 个信源在谈事件专题推荐理由:OpenAI搞了个自动红队GPT-Red,专门找自家模型的提示注入漏洞,部署前先修好,安全又可靠。原文稍后读已读值得跟进有用关注 OpenAI
02:26官方账号OpenAI@OpenAI (@OpenAI)73°OpenAI 发布内部自动化红队测试系统 GPT-Red,旨在大规模发现其模型的提示注入漏洞。该工具通过自动化攻击模拟,帮助 OpenAI 在模型更广泛部署前识别并修复安全缺陷。GPT-Red 是 OpenAI 提升 AI 模型防御能力的关键举措,专注于提示注入这一常见攻击向量。AI产品OpenAIGPT-Redprompt injection10 个信源在谈事件专题推荐理由:OpenAI 造了个自动找提示注入漏洞的工具 GPT-Red,能大规模测试模型安全,帮你提前堵漏洞。原文稍后读已读值得跟进有用关注 OpenAI
01:14官方一手OpenAI Blog(博客/媒体)OpenAI发布了GPT-Red,一个自动化红队测试系统。该系统采用自我对弈机制,让大模型相互对抗生成测试用例,以提升对提示注入等攻击的鲁棒性。GPT-Red旨在通过自动化的对抗训练,持续改进AI模型的安全性和对齐性。AI产品GPT-RedOpenAIAI安全10 个信源在谈事件专题推荐理由:OpenAI搞了个新系统叫GPT-Red,让模型自己打自己来找出漏洞,专门防提示注入这类攻击,挺实用的。原文稍后读已读值得跟进有用关注 GPT-Red
11:59官方账号arXiv cs.AI@Xutao Mao, Xiang Zheng, Cong Wang73°论文提出AHA框架,通过自动化研究环境对Claude Code和Codex等生产智能体进行红队测试。AHA构建漏洞假设、生成攻击、在沙箱中执行并反思,将结果汇入Vulnerability Concept Graph(VCG)。实验覆盖直接与间接攻击场景,VCG无需额外搜索即可在单次攻击协议下超越最强基线14.2个百分点。VCG可跨模型和攻击渠道迁移,为安全团队提供可审计的漏洞知识库。论文Claude CodeCodexAHA推荐理由:想了解如何自动化挖Claude Code和Codex的漏洞?这篇论文提出了AHA方法,比现有方法强14%,还能跨场景复用。搞智能体安全的值得看。原文稍后读已读值得跟进有用关注 Claude Code
11:20官方账号arXiv cs.AI@Yujiao Chen论文提出 institutional red-teaming 方法论并实例化为 IABench-CA 基准,覆盖 228 个上下文、5 条规范规则及 7 个模型种群(共 33,924 局游戏)。结果显示:仅改变后果规则即可使平均死亡人数变动 22-58 个百分点。没有任何规则在所有种群中安全:最安全与最不安全的规则及其影响方向均随种群变化,但回归性身份定位从未成为任何上下文中的绝对安全策略,且在 30-87% 的游戏中去除了资源最少的智能体。对最易受剥削种群(gpt-5.1)的消融实验表明,规则文本中命名损失承担者使针对性消除从 22% 升至 81%;重复游戏下匿名化仅延迟定位,智能体从观察结果反推隐藏规则。论文多智能体AI安全红队测试推荐理由:这篇论文拿多个模型种群跑了几万局游戏,发现换一条规则,事故率能差 58 个百分点,而且匿名化也挡不住针对性消除。做多智能体安全的一定要看。原文稍后读已读值得跟进有用关注 多智能体
11:52官方账号arXiv cs.AI@Mona Schirmer, Metod Jazbec, Alexander Timans, Christian Naesseth, Maja Waldron, Eric Nalisnick尽管经过对齐训练,LLM在部署时仍会产生不安全输出。研究提出一种简单实时监控器,利用外部模型的验证器信号,通过风险控制(Risk Control)校准阈值来触发报警。在数学推理和红队数据集上,该简单方法与基于序列假设检验(Sequential Hypothesis Testing)的复杂监控器性能相当。实验表明,无需复杂统计模型即可有效监控LLM输出安全性。论文LLM风险控制安全监控推荐理由:这篇论文直接用阈值加风险控制就能搞定LLM安全监控,效果不输那些复杂方法,适合快速落地。原文稍后读已读值得跟进有用关注 LLM
06:42官方账号Latent Space (swyx)(博客/媒体)Zico Kolter(OpenAI董事会成员)和Matt Fredrikson(Gray Swan CEO)在Latent Space播客中讨论了AI安全的独特性。他们强调,AI安全不是'网络安全加上AI',而是需要新的方法论。Gray Swan专注于AI安全测试,红队测试在部署前至关重要。该访谈深入剖析了当前AI安全的挑战与误区。行业OpenAIGray Swan红队测试10 个信源在谈事件专题推荐理由:想听两位大佬聊聊AI安全为什么不一样?Zico Kolter和Matt Fredrikson告诉你红队测试的真正作用。原文稍后读已读值得跟进有用关注 OpenAI
12:41官方账号arXiv cs.AI@Blake Bullwinkel, Eugenia Kim, Amanda Minnich, Mark Russinovich精选本文提出AdvGRPO框架,解决了GRPO在攻防协同训练中不稳定的问题。通过密集多通道奖励和分离优势归一化,使攻击者和防御者模型交替更新,从单轮攻击逐步过渡到多轮闭环攻击。实验表明,该方法能生成高效且可迁移的攻击,协同训练的防御者在安全基准上优于基线。这项工作为语言模型的安全对齐提供了新的自适应红队方法。论文红队测试GRPO攻防协同推荐理由:做AI安全对齐的团队终于有了一个稳定的GRPO攻防协同训练方案,能同时提升攻击发现能力和防御鲁棒性,建议做红队测试的开发者直接参考。原文稍后读已读值得跟进有用关注 红队测试
13:42官方一手marktechpost@Sana Hassan精选本文是一篇关于 NVIDIA garak 框架的详细教程,指导用户如何构建防御性的大语言模型红队测试工作流。教程涵盖了环境搭建、插件发现、干运行、在 Hugging Face 生成器上进行真实模型扫描以及多探针评估。用户可以通过分析安全分数和攻击成功率来检查标记输出,并扩展 garak 以添加自定义探针和检测器。最后,教程演示了如何以 AVID 格式导出结果,实现结构化漏洞管理。AI产品NVIDIA garakLLM 安全红队测试9 个信源在谈事件专题推荐理由:对于需要系统化测试 LLM 安全性的团队,这个教程提供了从零到自定义探针的完整路径,建议直接跟着步骤搭建自己的红队流程。原文稍后读已读值得跟进有用关注 NVIDIA garak
11:10官方账号arXiv cs.LG@Sepehr Dehdashtian, Jacob H Seidman, Vishnu N Boddeti, Gaurav Bharaj音频深度伪造检测(ADD)模型对防御恶意TTS至关重要,但现有数据集构建面临手动收集和盲点发现低效的挑战。FoeGlass是首个黑盒自动化红队测试方法,利用LLM的上下文学习能力探索TTS输入空间,仅需黑盒访问即可生成欺骗ADD的音频样本。通过基于多样性度量的上下文设计,FoeGlass缓解了模式崩溃问题,在多个开源ADD和TTS模型上使假阴性率比基线提升高达94%。生成的攻击可跨不同ADD迁移,且用FoeGlass样本微调ADD模型可提升鲁棒性达41%。论文音频深度伪造红队测试上下文学习推荐理由:做音频安全或深度伪造检测的团队,终于有了一个无需手动标注就能自动发现模型盲点的工具——FoeGlass用LLM上下文学习就搞定了,建议直接跑一下开源代码看看效果。原文稍后读已读值得跟进有用关注 音频深度伪造
13:00官方一手arXiv: Anthropic@Galip Tolga Erdem精选72°这是首个大规模实证研究,测量了LLM在重复渗透测试中的行为一致性。研究对4个模型(Claude Sonnet 4、Gemini 2.5 Flash-Lite、GPT-4o-mini、qwen2.5-coder:14b)各进行100次攻击,目标为固定蜜罐(含OWASP Juice Shop等脆弱服务)。结果显示,Gemini 2.5 Flash-Lite成功率最高(85%),Claude因API故障中断39次但仍达61%,qwen仅25%且主要因过早完成失败。模型失败模式各异:Claude受API截断影响,qwen过早终止,GPT-4o-mini耗尽迭代预算。跨模型成功率差异显著(p<0.001),且首次利用时间集中在15-30秒内。论文LLM安全渗透测试攻击一致性推荐理由:这项研究揭示了LLM作为攻击者的行为规律和可靠性差异,做AI安全评估或红队测试的团队值得关注——它告诉你不同模型在真实攻击场景下的稳定性和失败模式,直接指导模型选型和防御策略。原文稍后读已读值得跟进有用关注 LLM安全
19:11官方账号arXiv cs.LG@Nikita Kezins, Urbas Ekka, Pascal Berrang, Luca Arnaboldi红队测试在实际中表现良好的护栏分类器无法提供形式化保证,因为“有害行为”缺乏离散输入空间中的自然规范。研究者提出将验证从离散输入空间转移到分类器的预激活空间,通过定义包含已知有害提示表示的有害区域,并利用sigmoid分类头的单调性,能在O(d)时间内给出封闭形式的可靠性证明。该框架应用于三种毒性护栏分类器,所有超矩形配置均返回SAT(即存在安全漏洞),而概率性高斯混合模型证书则揭示了模型表示危害的结构稳定性差异:GPT-2和Llama-3.1-8B保持90%和80%的覆盖率,但BERT的安全保证在最优阈值下覆盖率骤降至55%。这些方法提供了超越传统红队测试的护栏分类器有效性新见解。论文AI安全形式化验证护栏分类器推荐理由:该研究首次为LLM护栏分类器提供了形式化验证方法,揭示了高经验指标下隐藏的安全漏洞,对AI安全领域具有重要指导意义。原文稍后读已读值得跟进有用关注 AI安全