论文09:50Transformer架构如何通过跳接与归一化保持深度初始化秩想搞懂Transformer为什么深了还能训练?这篇从秩角度拆解跳接、归一化、双矩阵的设计逻辑,比堆实验更透彻。#Transformer#秩崩溃#初始化#归一化aarXiv cs.AI@Katie Everett原文稍后读已读值得跟进有用关注 Transformer
论文73°09:40缩小初始化尺度持续改善大语言模型预训练发现一个几乎零成本的训练技巧:缩小初始化尺度能大幅提升大模型推理能力。#初始化#大语言模型#推理#预训练aarXiv cs.AI@Liangkai Hang 等 6 人原文稍后读已读值得跟进有用关注 初始化