5月29日
11:06
11:06官方账号arXiv cs.AI@Chunru Lin, Hongxin Zhang, Fenghao Yu, Zhehuan Chen, Thomas L. Griffiths, Yejin Choi, David Held, Chuang Gan
RoboWits 是一个双手机器人基准测试,旨在系统评估机器人在意外条件下的认知推理、创造性工具使用和鲁棒性。研究团队提出了一个多智能体协作框架,自动生成包含几何、材料和装配推理的 30 个种子任务和 208 个变异任务。测试发现,预训练的视觉-语言-动作模型(VLA)在种子任务上表现尚可,但在变异任务上表现脆弱,无法应对需要推理和策略适应的操作场景。这表明当前机器人策略在创造性问题解决方面存在显著差距。
推荐理由:机器人研究者终于有了一个专门测试认知推理和意外应对的基准——RoboWits 揭示了 VLA 模型在变异任务上的脆弱性,做机器人操作和具身智能的团队值得关注这个评估框架。
5月28日
11:36
11:36官方一手arXiv: OpenAI@Ian Diks, Harihara Muralidharan, Tim Proctor, Kenny Workman
精选
研究人员推出 SpatialBench-Long 基准测试,专门评估 AI 智能体在空间生物学中的长程科学推理能力。该基准包含 24 个评估任务,涵盖胰腺癌、胶质母细胞瘤、肺癌等多种疾病模型,涉及 CosMx、Visium、Xenium 等多种空间转录组学技术。任务要求智能体从原始或近原始数据中恢复生物学结论,而非执行预设分析流程。当前最佳模型(Gemini 3.5 Flash、GPT-5.5 等)在 72 次运行中仅完成 8 次(11.1%),表明该任务极具挑战性。该基准通过确定性评分和专家审查确保结果可靠性。
推荐理由:空间生物学研究者终于有了衡量AI科学推理能力的硬核基准——SpatialBench-Long 要求智能体从复杂空间数据中推导真实结论,而非简单跑流程。做生物信息学或AI for Science的团队,值得看看当前模型的表现差距在哪里。
02:42
02:42官方一手Hugging Face: Blog博客/媒体
IBM与Artificial Analysis联合推出ITBench-AA,这是首个针对企业IT运维场景的智能体基准测试。测试涵盖事件响应、故障排查等真实任务,结果显示包括GPT-4、Claude在内的前沿模型平均得分低于50%。该基准揭示了当前AI智能体在处理复杂企业IT流程时的能力短板,为行业提供了可量化的评估标准。
推荐理由:企业IT团队终于有了衡量AI智能体真实能力的标尺——前沿模型都不到50分,说明自动化运维还有很大提升空间,做IT运维或AI落地的建议点开看看差距在哪。
5月27日
5月26日
12:21
12:21官方账号arXiv cs.LG@Matt L. Wiemann, Lindsay M. Smith, Peter Melchior, Siddharth Mishra-Sharma, Andrew Gordon Wilson, Pavel Izmailov, Carolina Cuesta-Lázaro
精选72°
研究人员推出了DiscoverPhysics基准,通过让LLM代理在22个物理规则偏离现实的模拟世界中自主发现运动定律,来评估其科学推理能力。每个世界由N体模拟器按需生成,代理需设计多轮实验、观察原始轨迹数据,并提交自然语言解释和Python实现。测试发现,最强模型仅能通过一半世界,尤其在需要发现隐藏结构时失败;开源模型在实验设计和结论提取上显著落后于商业模型。该基准揭示了预测准确性与解释质量之间的差距,强调假设修正和实验设计对概念理解的重要性。
推荐理由:这个基准直击LLM科学推理的软肋——从数据中归纳规律而非回忆知识,做AI评估或科学模拟的团队值得关注,它暴露了当前模型在长程推理和实验设计上的真实短板。
11:49
11:49官方账号arXiv cs.AI@Junyuan Liu, Xinglei Wang, Zichao Zeng, Jiazhuang Feng, Quan Qin, Ilya Ilyankou, Guangsheng Dong, Tao Cheng
精选
城市表示学习将复杂城市环境编码为通用嵌入,但现有评估多局限于少数城市和任务,且随机划分导致空间泄漏,高估性能。CityRep 提出统一基准,包含空间单元无关的评估框架、基于区块的空间划分协议,以及覆盖 8 城市 8 任务的可扩展套件。评估 11 个模型发现,随机划分会扭曲性能排名,且模型表现因城市和任务差异显著。该基准提供数据集、评估管道和诊断工具,旨在推动城市表示学习的公平比较和泛化能力研究。
推荐理由:城市表示学习领域终于有了一个靠谱的评估标准——CityRep 解决了空间泄漏和跨城市泛化评估的痛点,做城市计算或地理空间 AI 的研究者可以直接用这个基准来检验自己的模型,避免被随机划分的虚假高分误导。
11:45
11:45官方账号arXiv cs.AI@Yusong Lin, Xinyuan Liang, Haiyang Wang, Qipeng Gu, Siqi Cheng, Jiangui Chen, Shuzhe Wu, Feiyang Pan, Lue Fan, Sanyuan Zhao, Dandan Tu
精选
Claw-Anything 是一个新基准,旨在评估大型语言模型代理作为始终在线个人助手的能力。现有系统仅能访问用户数字世界的狭窄部分,限制了上下文感知推理和有效协助。该基准通过三个维度扩展代理上下文:长期活动历史、相互依赖的后端服务以及跨多设备的 GUI 和 CLI 交互。实验显示,GPT-5.5 仅达到 34.5% 的 pass@1,远低于先前基准,突显了当前代理能力与始终在线个人助手需求之间的差距。同时,研究团队发布了自动化数据生成管道,可生成 2000 个训练环境,并将基础模型性能提升 23.7%。
推荐理由:这个基准测试揭示了当前 AI 代理在理解用户完整数字生活方面的巨大短板,做个人助手或智能体开发的团队值得关注——它直接指出了现有系统为何不够智能,并提供了改进方向。
5月25日
5月22日
5月21日
22:19
22:19官方账号Logan Kilpatrick@OfficialLoganK
76°
Gemini 3.5 Flash 在 APEX-Agents-AA 基准测试中排名第一,超越了参数规模更大的模型。该基准专注于智能体能力评估,Gemini 3.5 Flash 以较小模型实现了领先性能,展示了高效架构的优势。这一结果对智能体开发领域具有重要意义,表明模型效率与性能可以兼得。

推荐理由:智能体开发者可以关注:Gemini 3.5 Flash 用更小参数实现了更强性能,意味着更低成本和更快响应,值得在项目中尝试。
12:27
12:27官方账号arXiv cs.LG@Elle Miller, Jayaram Reddy, Ayush Deshmukh, Trevor McInroe, David Abel, Oisin Mac Aodha, Sethu Vijayakumar
精选72°
机器人触觉强化学习(RL)研究因碎片化和过度关注饱和的定向任务而受阻。roto 2.0 是一个 GPU 并行化的基准测试,覆盖四种不同机器人形态(16-24 自由度),专注于仅依赖本体感觉和触觉的“盲”操作,无需状态信息或知识蒸馏。其盲代理在 10 秒内完成 13 次 Baoding 球旋转,速度比当前最先进水平快一个数量级。通过开源环境和调优基线,该工作降低了入门门槛,让研究者能聚焦核心算法挑战。
推荐理由:触觉 RL 终于有了标准化的 GPU 并行基准,做机器人操作和强化学习的团队可以直接用 roto 2.0 测试算法,不用再花时间调环境——盲操速度提升 10 倍的结果值得点开看看。
11:01
11:01官方账号arXiv cs.AI@Sixiong Xie, Zhuofan Shi, Haiyang Shen, Jiuzheng Wang, Siqi Zhong, Mugeng Liu, Chongyang Pan, Peilun Jia, Baoqing Sun, Xiang Jing, Yun Ma
精选72°
DeepWeb-Bench 是一个新的深度研究基准,旨在评估 AI 模型在开放网络上进行复杂研究的能力。与现有基准不同,该基准要求模型进行大规模证据收集、跨来源整合和长链条多步推理,难度显著提升。研究对九个前沿模型进行了评估,发现检索并非主要瓶颈(仅占12-14%错误),而推导和校准失败占70%以上。强模型和弱模型的失败模式不同:强模型主要因推导不完整出错,弱模型则因虚假精确性出错。该基准还揭示了模型在领域上的真实专长差异,跨模型一致性仅为0.61。
推荐理由:做 AI 评估或研究基准的团队会发现,DeepWeb-Bench 揭示了现有基准无法区分的模型能力差异——尤其是推导和校准的短板。建议关注其分能力族评估和来源溯源设计,这对理解模型真实研究能力很有帮助。
5月20日