6月2日
12:06
12:06官方一手arXiv: DeepSeek@Boao Kong, Weichen Jia, Engao Zhang, Guohong Li, Yonghan Dong, Yao Wang, Yaoyuan Wang, Yunke Peng, Kun Yuan
低精度训练在降低大模型训练成本的同时,常因少数算子的数值不稳定导致训练失败。论文提出GNMR(梯度范数与均值比)轻量控制器,通过比较当前梯度范数与历史均值,并结合Δ-GNMR检测短窗口内的突变,在固定预算和锁定间隔内执行恢复操作,无需改变数值格式或底层实现。在激活量化、DeepSeek式训练和LLaMA-2 13B微调等场景中,GNMR以稀疏的恢复动作保持高保真质量。该方法为低精度训练提供了一种后端无关的稳定性控制方案。
推荐理由:低精度训练是降低大模型成本的关键,但数值不稳定常让训练白费。GNMR用轻量控制解决了这个痛点,做大规模训练或量化训练的团队值得关注,可以直接集成到现有流程中。
5月26日
10:16
10:16官方一手pandaily@contact@pandaily.com (Pandaily)
精选72°
Bingbi AI 开源了 BitCPM-CANN 训练框架,支持在国产 AI 加速器上进行 1.58-bit 模型训练。相比全精度训练,该框架可将推理内存需求降低最多六倍,显著降低硬件门槛。这一开源举措有望推动国产算力生态发展,让更多开发者和团队在国产芯片上高效训练和部署大模型。

推荐理由:国产算力生态终于有了低精度训练的利器——1.58-bit 训练框架让国产芯片也能高效跑大模型,做国产 AI 部署的团队可以直接拿来用,内存省六倍,值得关注。
5月12日
19:11
19:11官方账号arXiv cs.AI@Liang Luo, Yinbin Ma, Quanyu Zhu, Vasiliy Kuznetsov, Yuxin Chen, Jian Jiao, Jiecao Yu, Buyun Zhang, Tongyi Tang, Xiaohan Wei, Yanli Zhao, Zeliang Chen, Yuchen Hao, Venkatesh Ranganathan, Sandeep Parab, Yantao Yao, Maxim Naumov, Chunzhi Yang, Shen Li, Ellie Wen, Wenlin Chen, Santanu Kolay, Chunqiang Tang
LoKA(低精度内核应用)框架解决了FP8低精度计算在大型推荐模型(LRM)中的困境。由于LRM对数值敏感且包含大量小矩阵乘法和归一化操作,直接应用FP8会降低模型质量并增加训练时间。LoKA通过系统-模型协同设计,包含三个核心组件:LoKA Probe在线评估每层精度误差,LoKA Mods提供提升数值稳定性的模型修改,LoKA Dispatch动态选择最快且安全的FP8内核。该方法使FP8在推荐模型中实用化,同时保障精度和训练效率。
推荐理由:该研究为推荐系统领域提供了实用的低精度训练方案,解决了FP8在数值敏感场景下的适配难题,对工业级推荐模型的训练加速具有实际参考价值。