AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

内部表征

共 1 条相关 AI 资讯
9月2日
09:36
09:36官方账号arXiv cs.AI@Xining Xun
精选73°
研究显示在Pythia模型套件(160M-12B参数)中,线性探针可在第1000步读取目标变量,但沿相同方向的引导在48个模型检查点中有43个无效。内部可读性系统性地领先于因果效力,且这种滞后不会随规模缩小。研究将此结构分解为三个可分离的轨迹:内部可读性在第一个检查点就已饱和(AUROC≥0.990),行为可读性随规模逐渐发展且出现更晚(12B模型仅在最后检查点达到0.909),因果效力几乎总是无效。
论文Pythia滞后耦合内部表征

推荐理由:MIT发现AI模型内部表征可读性先于因果性,这一滞后现象在12B参数规模下依然存在,挑战了传统模型理解。
原文
精选全部日报登录