论文11:13
Transformer Geometry Observatory TGO-I: 视觉Transformer的光谱几何研究这篇论文用TGO框架搞清楚了ViT的维度在训练中怎么变化——不是集中而是越来越分散,尤其CLS token最明显,对理解视觉Transformer内部机制很有参考价值。
这篇论文用TGO框架搞清楚了ViT的维度在训练中怎么变化——不是集中而是越来越分散,尤其CLS token最明显,对理解视觉Transformer内部机制很有参考价值。
这篇论文用几何视角重新定义了灾难性遗忘,做持续学习或模型遗忘研究的开发者会看到新方向——遗忘不是删除,而是藏起来了。建议关注其恢复子空间维度的测量方法,可能启发新的抗遗忘算法。