论文精选11:35MLA瓶颈分离内容与位置:DeepSeek-V2注意力机制可解释性研究想看MLA到底怎么工作的?这篇论文用114M模型做实验,发现cKV只记内容不记位置,还能省81%缓存,归纳头也全挤在一层,挺有意思的。#MLA#DeepSeek-V2#可解释性#注意力机制aarXiv: DeepSeek@Dhruvil S 等 3 人原文稍后读已读值得跟进有用关注 MLA