09:35官方账号arXiv cs.AI@Minghui Xu, Zi Wang精选73°研究分析了大语言模型在Countdown任务中的计算错误问题。构建了监督微调数据集教授模型工具使用模式。应用RLOO、RLOO++、GRPO和DAPO等强化学习方法。在1024题的独立测试基准上,Tool-DAPO将pass@1从35.8%提升至66.0%。强化学习鼓励更有效的工具使用,即使只提供最终答案奖励。技巧数学推理工具集成强化学习推荐理由:OpenAI研究团队用计算器工具+强化学习,把数学推理准确率提升30个百分点,方法开源可复现。原文稍后读已读值得跟进有用关注 数学推理