10:29官方账号arXiv cs.AI@Gerard Conangla Planes精选本文提供了一种针对Transformer注意力中低秩适应(LoRA)更新的秩选择的理论,针对每个LoRA秩提供了可达到的近似误差。证明了在目标注意力概率远离零的情况下,误差的下界与$ψ(\|d\|_2)$成比例,其中$d$是候选和目标注意力分数之间的差异。还提供了当候选分数保持在目标分数固定范围内时的目标-Fisher界限,以及当大部分概率质量集中在子集标记上的无限制下界。这些光谱界限描述了有限分数近似。最后,将分析扩展到融合多头LoRA和联合查询/键更新,揭示了秩共享和查询/键分解约束的影响。论文Transformer注意力LoRA误差界限推荐理由:这篇论文提供了Transformer注意力中LoRA秩选择的深入理论分析,对于理解LoRA在Transformer模型中的应用非常有帮助,特别是对于想要优化模型性能的工程师来说。原文稍后读已读值得跟进有用关注 Transformer注意力