11:22官方账号arXiv cs.AI@Xuehai Wang, Haowei Qin, Tongxin Liu, Junkai Li, Buqiang Xu, Jintian Zhang, Yijun Chen, Zirui Xue, Shumin Deng精选73°AutoSciRub是一个评估优先框架,在研究执行前自动生成任务特定可执行评分标准。该框架将模糊指令分解为原子科学目标,基于相关文献和任务可见数据建立标准,并在ResearchClawBench基准测试中平均提升2.08分,在AstaBench E2E Discovery子集上提升16.8分。论文AutoSciRubResearchClawBenchAstaBench推荐理由:ZJU团队推出AutoSciRub,让AI研究代理先定标准再执行,在多个基准测试中显著提升研究质量。原文稍后读已读值得跟进有用关注 AutoSciRub