10:07官方账号arXiv cs.LG@Zhiliang Chen, Sebastian Ament, David Eriksson, Maximilian Balandat, Eytan Bakshy, Jihao Andreas Lin精选73°研究人员提出Power-Law Entropy Search (PLES)方法,用于高效估计大语言模型训练的最佳超参数缩放定律。PLES基于多保真度贝叶斯优化,通过自适应实验减少计算资源消耗。在合成基准、真实LLM训练数据和实际预训练任务中,PLES仅需传统网格搜索不到十分之一的计算量,就能收敛到准确的超参数缩放定律。论文PLES超参数缩放定律贝叶斯优化推荐理由:PLES让大模型训练调参效率提升10倍,用小规模实验预测大规模最优配置。原文稍后读已读值得跟进有用关注 PLES