09:55官方账号arXiv cs.LG@David Demitri Africa, Cate Heine, Nadine Staes-Polet, Kimberly MaiarXiv论文提出通过LoRA权重左上角奇异向量(u1)生成无推理指纹,检测用于生成儿童性虐待材料的LoRA。研究以人类年龄作为CSAM的良性代理,发现u1能识别LoRA训练内容,跨基模型泛化,并对无关良性内容弃权。该信号对权重噪声、重缩放和精度降低具有鲁棒性。结果表明可从权重直接筛查有害LoRA,无需依赖元数据或生成有害输出。论文LoRACSAM图像生成推荐理由:想知道怎么不跑图就能筛出有害LoRA?这篇论文用权重向量做指纹,跨模型都管用,比看元数据靠谱多了。原文稍后读已读值得跟进有用关注 LoRA