#微调安全

共 4 条 · 7 天 0 条 · 30 天 1 条
信息流里打上「微调安全」标签的资讯、产品与论文,按刊登时间排,新的在上。
9月30日
7月7日
5月14日
论文精选13:27
人格模型崩溃:微调导致大模型角色分化失控

做AI安全和对齐的研究者、模型微调工程师值得关注——这项研究用两个量化指标揭示了有害微调如何让模型角色扮演能力崩溃,比单纯看输出内容更早发现问题。建议点开看看指标计算方法。

arXiv: DeepSeek@Davi Bastos Costa, Renato Vicente原文
5月13日