7月29日
03:12
03:12官方一手Anthropic: Research资讯
Anthropic的Frontier Red Team使用Claude找到了多个密码学实现中的安全弱点。该团队通过Claude分析了常见加密协议的逻辑与实现细节。结果表明Claude能发现传统工具难以察觉的漏洞。
事件专题

推荐理由:Anthropic的红队用Claude找出了密码学实现里的漏洞,比传统静态分析工具更聪明,值得看他们的方法。
7月16日
01:14
01:14官方一手OpenAI Blog博客/媒体
OpenAI发布了GPT-Red,一个自动化红队测试系统。该系统采用自我对弈机制,让大模型相互对抗生成测试用例,以提升对提示注入等攻击的鲁棒性。GPT-Red旨在通过自动化的对抗训练,持续改进AI模型的安全性和对齐性。
事件专题

推荐理由:OpenAI搞了个新系统叫GPT-Red,让模型自己打自己来找出漏洞,专门防提示注入这类攻击,挺实用的。
6月23日
6月9日
12:41
12:41官方账号arXiv cs.AI@Blake Bullwinkel, Eugenia Kim, Amanda Minnich, Mark Russinovich
精选
本文提出AdvGRPO框架,解决了GRPO在攻防协同训练中不稳定的问题。通过密集多通道奖励和分离优势归一化,使攻击者和防御者模型交替更新,从单轮攻击逐步过渡到多轮闭环攻击。实验表明,该方法能生成高效且可迁移的攻击,协同训练的防御者在安全基准上优于基线。这项工作为语言模型的安全对齐提供了新的自适应红队方法。
推荐理由:做AI安全对齐的团队终于有了一个稳定的GRPO攻防协同训练方案,能同时提升攻击发现能力和防御鲁棒性,建议做红队测试的开发者直接参考。