论文13:13Tapered Language Models:沿深度锥形分配MLP参数提升性能这篇论文发现了一个简单技巧:同等算力下,把更多参数分给前几层、少给后几层,模型效果就能更好,试了多种架构都管用。#Tapered Language Models#Transformer#Titans#参数分配aarXiv cs.AI@Reza Bayat 等 3 人原文稍后读已读值得跟进有用关注 Tapered Language Models