论文10:08越狱攻击下鲁棒有害特征:注意力头专业化的机制证据这篇论文用注意力头机制解释了越狱攻击无法完全消除安全特征,还提出一种无需训练的检测方法,效果不输传统对抗训练。#越狱攻击#注意力头#LLM安全#对抗鲁棒性aarXiv cs.AI@Yanchen Yin 等 3 人原文稍后读已读值得跟进有用关注 越狱攻击
论文10:56检测隐藏ML训练:零开销遥测的对抗鲁棒性这篇论文用简单的NVML遥测就能高精度检测隐藏的ML训练,还能对抗各种伪装,对AI计算治理很有启发。#NVML#GPU工作负载分类#对抗鲁棒性#AI计算治理aarXiv cs.LG@Robi Rahman, Sabiha Tajdari原文稍后读已读值得跟进有用关注 NVML
模型10:51ARB4WM: 世界模型对抗鲁棒性统一评估基准想检验你的世界模型扛不扛揍?ARB4WM这个新基准专门测视觉扰动下的鲁棒性,比单看动作空间全面多了。#ARB4WM#Dreamer#世界模型#对抗鲁棒性aarXiv: Google DeepMind@Junjian Zhang 等 6 人原文稍后读已读值得跟进有用关注 ARB4WM
论文精选11:26半随机对抗下谱排序的逐项误差界做排序算法或对抗鲁棒性研究的团队,这篇论文给出了半随机对抗下谱方法的理论误差界,并提出了有效的重加权策略,值得关注。#谱排序#BTL模型#对抗鲁棒性#逐项误差aarXiv cs.LG@Dongmin Lee 等 3 人原文稍后读已读值得跟进有用关注 谱排序