论文官方一手
对抗鲁棒性在扰动类型间的迁移研究
精选理由
理解鲁棒性的跨扰动迁移机制,有助于设计更高效的对抗训练策略,减少对多种攻击类型单独训练的需求。
OpenAI研究发现,针对一种扰动类型(如L-infinity)训练的对抗鲁棒模型,其鲁棒性可以迁移至其他未训练过的扰动类型(如L2或空间变换)。该发现揭示了对抗训练中鲁棒性泛化的内在机制,为构建更通用的安全AI系统提供了理论基础。
理解鲁棒性的跨扰动迁移机制,有助于设计更高效的对抗训练策略,减少对多种攻击类型单独训练的需求。
OpenAI研究发现,针对一种扰动类型(如L-infinity)训练的对抗鲁棒模型,其鲁棒性可以迁移至其他未训练过的扰动类型(如L2或空间变换)。该发现揭示了对抗训练中鲁棒性泛化的内在机制,为构建更通用的安全AI系统提供了理论基础。
OpenAI 首席科学家 Pachocki 联合 Hinton 和 Bengio 写的论文,聊 AI 自己改进自己的风险,还喊话监管层要企业交底,观点很硬核。
Perplexity 和 Nvidia 搞了个沙盒 SPACE,让 9 个模型拿 root 权限试着越狱,108 次全没跑出去,搞智能体安全的可以看看。
Salesforce 这篇论文很有意思:训练多轮工具调用时只练关键那一步,在 BFCL v4 上能多拿 14 个点,做法讲得很清楚。