#SAE
共 9 条 · 7 天 1 条 · 30 天 2 条
信息流里打上「SAE」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月6日
9月22日
论文10:12
SAE 对比研究:Mamba 与 Pythia 潜在表征 99.98% 对齐有人拿 SAE 逐个对比 Mamba 和 Pythia 的内部特征,99.98% 几乎一样,做可解释性的可以看看。
9月9日
8月12日
7月29日
7月28日
论文11:45
稀疏自编码器同时编码概念与功能:特征效应的下游几何这篇论文用FEGA方法分析了稀疏自编码器特征的下游几何,发现大多数特征不是单方向,value-like和pointer-like特征效果不同,对理解模型可解释性很有启发。
7月21日
6月16日
论文11:11
CircuitLasso:可扩展的电路学习方法用于解释大语言模型这篇论文提出了CircuitLasso,能以更低成本达到和现有方法一样好的电路学习效果,还能揭示可解释的语义特征如何传播。