5月29日
11:06
11:06官方账号arXiv cs.AI@Yalun Dai, Yangyu Huang, Tongshen Yang, Yonghan Wang, Xin Zhang, Wenshan Wu, Qihao Zhao, Hao Li, Yuanyuan Gao, Kim-Hui Yap, Scarlett Li
该论文系统研究了数据组织对LLM训练的影响,提出四个关键准则:边界锐化、循环调度、课程连续性和局部多样性。基于这些准则,作者设计了两种新的数据排序方法STR和SAW,通过复用预计算的样本级分数,几乎不增加额外计算开销。实验表明,这些方法在预训练和SFT阶段均能提升训练稳定性和模型性能。对于追求训练效率的AI团队,这是一个低成本的优化方向。
推荐理由:数据组织是LLM训练中常被忽视的杠杆,STR和SAW方法几乎零成本就能提升训练效果,做预训练或SFT的团队值得一试。
5月21日
5月19日
10:18
10:18官方账号arXiv cs.AI@Mengtian Yang, Zhekun Zhang, Mingheng Wu, Jianwen Yan, Hanshi Sun, Li-wen Chang
精选72°
Charon 是一个用于大规模 LLM 训练和推理性能预测的统一、模块化、细粒度模拟器。它解决了因并行策略、系统优化和硬件配置复杂而难以优化部署的问题。实验表明,Charon 在不同模型和配置下预测误差始终低于 5.35%,在大型 GPU 集群训练场景下误差低于 3.74%。在实际推理部署中,Charon 发现了一种配置,将系统吞吐量提升至超过工程调优的基线,展示了其实际价值。
推荐理由:做 LLM 部署优化的工程师终于有了一个高精度模拟器来验证“如果…会怎样”的假设,Charon 能帮你快速找到最佳配置,避免盲目调参,建议直接看论文实验部分。