11:13官方账号arXiv cs.AI@Jiacheng Miao, Jin Mu, Guanhua Chen, James ZouFisher-R1是一个面向可靠假设检验的开源LLM代理,基于强化学习训练。研究团队构建了P-Bench基准,包含425个覆盖经济学、生物学和医学的假设检验任务。Fisher-R1-14B在P-Bench上平均相对成功率比DeepSeek-V4-Pro高21%,在最具挑战性的任务上高出26%。该模型还超过了GPT-5.4等强基线,表明带验证性统计奖励的强化学习能提升推理可靠性。论文Fisher-R1P-Bench假设检验3 个信源在谈事件专题推荐理由:开源模型Fisher-R1专治假设检验,比GPT-5.4和DeepSeek-V4-Pro都强,最难任务能提26%,搞数据分析的可以看看。原文稍后读已读值得跟进有用关注 Fisher-R1