#基准测试

共 630 条 · 7 天 33 条 · 30 天 142 条
5月29日
5月28日
论文精选11:36
SpatialBench-Long:评估AI在空间生物学中的长程推理能力

空间生物学研究者终于有了衡量AI科学推理能力的硬核基准——SpatialBench-Long 要求智能体从复杂空间数据中推导真实结论,而非简单跑流程。做生物信息学或AI for Science的团队,值得看看当前模型的表现差距在哪里。

arXiv: OpenAI@Ian Diks 等 4 人原文
5月27日
5月26日
论文精选11:49
CityRep:跨城市、任务与模态的城市表示统一基准

城市表示学习领域终于有了一个靠谱的评估标准——CityRep 解决了空间泄漏和跨城市泛化评估的痛点,做城市计算或地理空间 AI 的研究者可以直接用这个基准来检验自己的模型,避免被随机划分的虚假高分误导。

arXiv cs.AI@Junyuan Liu 等 8 人原文
5月25日
5月24日
5月23日
5月22日
5月21日
论文精选72°11:01
DeepWeb-Bench:更难的深度研究基准,揭示模型推理短板

做 AI 评估或研究基准的团队会发现,DeepWeb-Bench 揭示了现有基准无法区分的模型能力差异——尤其是推导和校准的短板。建议关注其分能力族评估和来源溯源设计,这对理解模型真实研究能力很有帮助。

arXiv cs.AI@Sixiong Xie 等 11 人原文
产品多源确认精选08:00
Terminal-Bench 扩展至科学领域:T-Bench Science 开放任务贡献

做科研的 AI 用户终于有了专门评估 AI 辅助科研能力的基准——T-Bench Science 直接面向真实工作流,科学家可以贡献自己的流程来推动模型进步,值得关注和参与。

事件专题
Thomas Wolf@Thom_Wolf11 个信源在谈原文
5月20日