论文11:39Defending Against Harmful Supervision Hidden in Benign Samples这篇论文揭示了有害微调的新方式,提出Embedded Attack和DR-SFT,对AI安全研究者很有启发。#Embedded Attack#DR-SFT#AI安全#微调aarXiv cs.AI@Bang An 等 6 人原文稍后读已读值得跟进有用关注 Embedded Attack