#大规模训练
共 4 条 · 7 天 0 条 · 30 天 0 条
信息流里打上「大规模训练」标签的资讯、产品与论文,按刊登时间排,新的在上。
8月24日
7月27日
NVIDIA新研究:AdamW存在规模上限,SOAP和Muon在大规模训练中更优
NVIDIA找到AdamW的短板了,批量干到1亿tokens它就崩,但SOAP和Muon依然稳,还解决了训练崩溃的毛病,训大模型可以看看这个。
5月18日
5月13日
NVIDIA找到AdamW的短板了,批量干到1亿tokens它就崩,但SOAP和Muon依然稳,还解决了训练崩溃的毛病,训大模型可以看看这个。