#微调安全
共 4 条 · 7 天 0 条 · 30 天 1 条
信息流里打上「微调安全」标签的资讯、产品与论文,按刊登时间排,新的在上。
9月30日
7月7日
论文12:11
Learning Only What Valid Adapters Can Express: Subspace-Constrained Adaptation Against Fine-Tuning Poisoning这篇论文告诉你一个防止投毒攻击的微调方法:只学有效适配器的子空间,在flan-t5-large上比LoRA安全很多。
5月14日
人格模型崩溃:微调导致大模型角色分化失控
做AI安全和对齐的研究者、模型微调工程师值得关注——这项研究用两个量化指标揭示了有害微调如何让模型角色扮演能力崩溃,比单纯看输出内容更早发现问题。建议点开看看指标计算方法。
5月13日
Overtrained, Not Misaligned:大模型微调中的“突发性错位”可避免
做LLM微调的团队终于有了避免“突发性错位”的实操指南——早期停止就能保留93%性能,建议所有做安全对齐的工程师点开看看具体阈值。