#AdamW
共 12 条 · 7 天 1 条 · 30 天 2 条
信息流里打上「AdamW」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月9日
9月29日
8月31日
8月10日
论文10:56
Muon训练的Transformer在后grokking阶段出现表示-读出界面崩溃Muon grok虽快,后grokking会崩到27.59%;冻结embedding/readout就能稳。想用Muon训Transformer的注意。
8月6日
8月5日
论文12:05
Muon相遇Mamba:状态空间模型的谱优化Muon优化器之前都在Transformer上测试,这篇论文把它用到Mamba-2 130M上,发现输出投影用Muon最划算,训练效率更高,值得看看。
8月3日
7月27日
NVIDIA新研究:AdamW存在规模上限,SOAP和Muon在大规模训练中更优
NVIDIA找到AdamW的短板了,批量干到1亿tokens它就崩,但SOAP和Muon依然稳,还解决了训练崩溃的毛病,训大模型可以看看这个。
7月20日
6月30日
论文15:35
One-Step Gradient Delay不是大规模异步流水线并行LLM预训练的障碍这篇论文用Muon优化器颠覆了'异步流水线并行梯度延迟必然拉胯训练'的老观念,10B参数实验证明性能和同步训练一样好,做大型LLM预训练的同学应该看看。
6月23日
5月21日