AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

特征几何

共 1 条相关 AI 资讯
7月28日
11:45
11:45官方账号arXiv cs.LG@Phu Gia Hoang, Anwoy Chatterjee, Tanmoy Chakraborty, Iryna Gurevych, Subhabrata Dutta
稀疏自编码器(SAE)作为可解释性工具,常因特征与模型行为间链接不一致而受限。论文提出特征效应几何分析(FEGA)框架,通过跨上下文移除相同活跃SAE特征并分析logit变化云。发现一致的一维效应罕见,仅有少数特征像可重用方向。将特征分为value-like(静态信息)和pointer-like(上下文相关操作),前者更多表现出结构化低维效应,后者则呈现扩散效应。研究表明,特征虽可解释且有因果关联,但未必提供稳定操控方向。
论文SAEFEGA可解释性

推荐理由:这篇论文用FEGA方法分析了稀疏自编码器特征的下游几何,发现大多数特征不是单方向,value-like和pointer-like特征效果不同,对理解模型可解释性很有启发。
原文
精选全部日报登录