AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

DeepSeek-V2

共 1 条相关 AI 资讯
7月28日
11:35
11:35官方一手arXiv: DeepSeek@Dhruvil S, Fenil Sojitra, Ravirajsinh Chauhan
精选
论文首次对DeepSeek-V2引入的多头潜在注意力(MLA)进行全面的可解释性分析。研究者训练了一个114M参数的Transformer,在TinyStories上微调后通过SVD、线性探针等方法发现:共享低秩瓶颈cKV保留了98%的实体身份信息,几乎完全丢弃位置信息,实现了81%的KV缓存压缩。归纳头集中在第12层,而标准多头注意力中它们分布在不同层。瓶颈平均仅使用46%的容量,存在过度配置。这些结果揭示了MLA并非被动压缩,而是主动重塑了模型的内容组织、位置编码和电路结构。
论文MLADeepSeek-V2可解释性

推荐理由:想看MLA到底怎么工作的?这篇论文用114M模型做实验,发现cKV只记内容不记位置,还能省81%缓存,归纳头也全挤在一层,挺有意思的。
原文
精选全部日报登录