11:51官方账号arXiv cs.LG@Robert Hu, Carlo Luschi, Paul Balanca精选73°研究人员提出了一种新的UE5M3 FP4块缩放方法,用于稳定4位浮点预训练。该方法通过将E2M1负载与无符号E5M3块缩放配对,在Nemotron-H 8B模型上预训练了近1900亿个token。与Transformer Engine v方法相比,新方法实现了更低的最终窗口训练损失和验证损失,量化推理下游点估计在所有三个报告聚合上表现更好。论文Nemotron-HFP4UE5M3推荐理由:NVIDIA提出新方法让FP4预训练更稳定,训练速度提升21.2%,模型性能全面超越现有方案。原文稍后读已读值得跟进有用关注 Nemotron-H