09:42官方账号arXiv cs.AI@Chi Wang, Hanwen Wang, Yu Xia, Zihan Wang, Guangdong BaiCaliber是一种针对分数返回API的模型提取防御方法,通过向内部logits添加独立同分布高斯噪声来干扰攻击者。论文证明噪声尺度与预测一致性单调递减,并推导了固定输入下恢复干净logits所需查询次数的闭式极小极大下界。在三十多个模型-数据集组合上,逐模型校准的平均绝对相对误差为0.6%-1.4%。端到端实验显示替代模型性能与配置的退化程度一致。论文Caliber模型提取API安全推荐理由:这篇论文提出了Caliber,一种给API返回分数加噪的防御方法,能控制攻击者提取模型的成本,还给出了理论保证和实验数据。原文稍后读已读值得跟进有用关注 Caliber