论文多源确认11:13Fisher-R1:训练LLM代理实现可靠假设检验开源模型Fisher-R1专治假设检验,比GPT-5.4和DeepSeek-V4-Pro都强,最难任务能提26%,搞数据分析的可以看看。#Fisher-R1#P-Bench#假设检验#智能体3 个信源在谈事件专题aarXiv cs.AI@Jiacheng Miao 等 4 人4 个信源在谈原文稍后读已读值得跟进有用关注 Fisher-R1
论文10:05条件查询下的假设检验:可学习性与交互的价值如果你搞模型评估设计,这篇理论文章用严格上下界讲清楚了交互测试比固定测试省多少查询:最多二次方,不是指数级。#假设检验#条件查询#自适应查询#非自适应查询aarXiv cs.LG@Zonghuan Xu原文稍后读已读值得跟进有用关注 假设检验