论文Agent 与开发者精选09:26研究提出新方法检测大模型潜在学习效应朋友,有个挺有意思的研究,他们开发了一种叫SALVE的新方法,专门用来检测大模型学习过程中那些“偷偷摸摸”学到的知识,挺有意思的。#SALVE#subliminal learning#文本优化#大模型安全aarXiv cs.LG@Nathan Hu 等 3 人原文稍后读已读值得跟进有用关注 SALVE
论文精选09:41Subliminal Learning 通过单一 steering vector 实现,揭示向量蒸馏机制这篇论文揭示了 AI 模型微调中一个反直觉的机制——模型能从语义无关数据中习得隐藏特质,做模型对齐或安全研究的团队值得关注,看完会对数据蒸馏的潜在风险有新认识。#subliminal learning#steering vector#向量蒸馏#模型对齐aarXiv cs.AI@Camila Blank 等 5 人原文稍后读已读值得跟进有用关注 subliminal learning