论文政策与合规09:33AARR 基准测试:评估前沿 LLM 和智能体在研究生命周期中的表现这个基准直击当前 AI 智能体在研究场景中的短板——不是执行能力不够,而是缺乏研究者的细腻判断。做 AI 评估或智能体开发的团队值得关注,它揭示了提升 AI 研究素养的新方向。#基准测试#LLM#智能体#研究自动化aarXiv cs.AI@Jiayu Wang 等 11 人原文稍后读已读值得跟进有用关注 基准测试