用模型内部激活训练探针抓欺骗,SHADE-Arena 上 AUC 98.8%,比直接读文本监控的 Opus 5.5 还准,数据集也开源了。
#可解释性
共 207 条 · 7 天 8 条 · 30 天 33 条
信息流里打上「可解释性」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月9日
白盒探针检测大模型欺骗,SHADE-Arena 上 AUC 达 98.8%
10月8日
10月6日
PaSS:用迭代零空间投影提取人格子空间,实现 LLM 行为控制
PaSS 不训练模型,用 INLP 在推理时把人格拆成多维子空间来放大或抑制某种特质,在 MATH-500、GSM8K 上验证比单方向激活导向更细。
9月29日
arXiv 论文提出 MoralLedger:道德历史可线性操纵 LLM 道德决策
研究者做了个 MoralLedger 框架,发现你之前干过啥会改变 LLM 的道德判断,还能沿一个内部方向直接干预改写它的选择,比单纯改提示词管用。
论文13:24
论文研究电路评估方法:可复现成功却解释不了模型错误做可解释性的朋友看过来:这篇用 GPT-2 的 IOI 实验说明现有电路验证方法基本只看正确样本,错误复现率低到 11.4%,方法上值得反思。
9月28日
9月25日
研究揭示 MLLM 视觉-文本对齐分数可能是几何假象
有人测试了 13 个多模态模型,发现 CKA 这些常用的对齐指标根本测不出视觉信息是否真被用上,还给出了新指标 PA gap,做可解释性分析的值得看看。
9月24日
9月23日
谱理论解释 grokking 现象:weight decay 驱动特征学习
研究 grokking 为什么突然泛化的论文,理论算出 grokking 时间由学习率乘 weight decay 决定,还用上千个网络验证了,做可解释性的可以看看。
9月22日
论文10:12
SAE 对比研究:Mamba 与 Pythia 潜在表征 99.98% 对齐有人拿 SAE 逐个对比 Mamba 和 Pythia 的内部特征,99.98% 几乎一样,做可解释性的可以看看。
9月21日
论文11:10
arXiv 论文证明类 Laplace 源下非线性 ICA 可精确识别用 Laplace 分布的折点特性证明了非线性 ICA 能精确恢复隐因子,CelebA 实验里真拆出了控制单一属性的因子
RegKT 模型提升知识追踪的准确性与可解释性
这篇论文介绍了一种叫 RegKT 的新技术,专门用来提升知识追踪模型的性能,让它在处理教育数据时更稳定,不容易过拟合,同时还能保持模型的可解释性,对做教育应用的开发者可能有帮助。
9月17日
Baseten 与 GoodfireAI 联合推动开源模型安全与可解释性研究
Baseten 和 GoodfireAI 联手,把安全研究直接加到 Baseten 的推理里,让客户用起来更安全,值得看看。
9月16日
9月9日
9月8日
9月7日
9月4日
9月2日
8月27日