12:03官方账号arXiv cs.LG@Hang Zhang, Warren J. GrossPPL-Factory提出了基于困惑度(perplexity)的任务感知和预算感知数据选择框架,用于大语言模型微调。在GSM8K上仅用1%训练数据即超越现有最佳方法;用10%数据在GSM8K上超过全量微调0.9个点,在MATH上超出4.8个点。该方法通过区分语言建模与推理任务的不同学习目标,实现高效且可解释的数据筛选。论文PPL-Factory数据选择微调推荐理由:想省训练成本又想模型推理更强?PPL-Factory用10%数据在MATH上比全量微调高4.8,门槛低、效果还更炸。原文稍后读已读值得跟进有用关注 PPL-Factory