论文官方一手
对抗性样本:机器学习模型的攻击方法
精选理由
对抗性样本是AI系统安全的核心威胁,了解其原理有助于开发更鲁棒的模型和防御策略。
本文介绍了对抗性样本的概念,即攻击者故意设计的输入,使机器学习模型产生错误判断,类似于机器的视觉错觉。文章展示了对抗性样本在不同媒介(如图像、文本)中的应用,并讨论了防御这些攻击的难点。这对理解AI安全性和鲁棒性至关重要。
对抗性样本是AI系统安全的核心威胁,了解其原理有助于开发更鲁棒的模型和防御策略。
本文介绍了对抗性样本的概念,即攻击者故意设计的输入,使机器学习模型产生错误判断,类似于机器的视觉错觉。文章展示了对抗性样本在不同媒介(如图像、文本)中的应用,并讨论了防御这些攻击的难点。这对理解AI安全性和鲁棒性至关重要。
OpenAI 首席科学家 Pachocki 联合 Hinton 和 Bengio 写的论文,聊 AI 自己改进自己的风险,还喊话监管层要企业交底,观点很硬核。
Perplexity 和 Nvidia 搞了个沙盒 SPACE,让 9 个模型拿 root 权限试着越狱,108 次全没跑出去,搞智能体安全的可以看看。
Salesforce 这篇论文很有意思:训练多轮工具调用时只练关键那一步,在 BFCL v4 上能多拿 14 个点,做法讲得很清楚。
Chelsea Finn 团队写了篇博客,讨论机器人怎么走 LLM 后训练的老路,还给出 EXPO-FT 方法,抓鸡蛋这类任务做到了 30 次全成功,只花 19 分钟真机交互。