09:50官方账号arXiv cs.AI@Katie Everett该论文揭示了Transformer前馈块中跳接和归一化不仅控制幅度,还通过调整分支与跳接的比例来保留梯度的秩。实验表明Pre-Norm使秩趋于平稳,而Post-Norm导致秩崩溃。双矩阵结构的宽度扩展遵循Marchenko-Pastur律,在CIFAR-10上输入-输出雅可比矩阵的初始化秩可预测网络训练性能。论文Transformer秩崩溃初始化推荐理由:想搞懂Transformer为什么深了还能训练?这篇从秩角度拆解跳接、归一化、双矩阵的设计逻辑,比堆实验更透彻。原文稍后读已读值得跟进有用关注 Transformer
09:40官方账号arXiv cs.AI@Liangkai Hang, Junjie Yao, Zhiyu Li, Feiyu Xiong, Hongkang Yang, Zhi-Qin John Xu73°论文发现缩小参数初始化尺度能持续改善大语言模型的预训练效果,在推理密集型任务上提升最为显著,同时识别出两种常见训练设置会抑制该优势。研究揭示了初始化尺度的关键平衡点,并发现小初始化驱动参数先凝聚为低复杂度结构再扩展为丰富表示。基于此提出γ初始化规则——将初始化范围作为可调旋钮,默认使用小初始化几乎不增加成本即可改善训练和推理。论文初始化大语言模型推理推荐理由:发现一个几乎零成本的训练技巧:缩小初始化尺度能大幅提升大模型推理能力。原文稍后读已读值得跟进有用关注 初始化