论文09:42Caliber:跨架构的分数返回API提取成本控制这篇论文提出了Caliber,一种给API返回分数加噪的防御方法,能控制攻击者提取模型的成本,还给出了理论保证和实验数据。#Caliber#模型提取#API安全#对抗防御aarXiv cs.AI@Chi Wang 等 5 人原文稍后读已读值得跟进有用关注 Caliber
论文11:39Defending Against Harmful Supervision Hidden in Benign Samples这篇论文揭示了有害微调的新方式,提出Embedded Attack和DR-SFT,对AI安全研究者很有启发。#Embedded Attack#DR-SFT#AI安全#微调aarXiv cs.AI@Bang An 等 6 人原文稍后读已读值得跟进有用关注 Embedded Attack