AITP
精选全部 AI 动态AI 日报Agent 接入关于更新日志信源提报反馈
登录 / 注册
AITOP
全部 AI 动态
AI 相关资讯全量信息流
全部博客资讯推文论文
全部模型产品行业论文技巧
标签:空间生物学×
6月16日
20:46
AITOP6月16日 20:46
600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI
6月12日
12:57
AITOP6月12日 12:57
Claude代码里藏了个20260612,18个月后的AI记忆革命已经开始倒计时
6月11日
15:28
AITOP6月11日 15:28
1107 vs 303:谷歌悄悄开源了一个“拆打字机”的模型,把大模型速度翻了4倍
15:23
AITOP6月11日 15:23
DiffusionGemma颠覆文本生成?自回归模型的“统治”要结束了
15:07
AITOP6月11日 15:07
每秒1107个token,Google开源的扩散模型为什么能改变本地推理格局?
5月28日
11:36
11:36arXiv: OpenAI@Ian Diks, Harihara Muralidharan, Tim Proctor, Kenny Workman
精选
研究人员推出 SpatialBench-Long 基准测试,专门评估 AI 智能体在空间生物学中的长程科学推理能力。该基准包含 24 个评估任务,涵盖胰腺癌、胶质母细胞瘤、肺癌等多种疾病模型,涉及 CosMx、Visium、Xenium 等多种空间转录组学技术。任务要求智能体从原始或近原始数据中恢复生物学结论,而非执行预设分析流程。当前最佳模型(Gemini 3.5 Flash、GPT-5.5 等)在 72 次运行中仅完成 8 次(11.1%),表明该任务极具挑战性。该基准通过确定性评分和专家审查确保结果可靠性。
论文空间生物学基准测试AI智能体科学推理SpatialBench-Long

推荐理由:空间生物学研究者终于有了衡量AI科学推理能力的硬核基准——SpatialBench-Long 要求智能体从复杂空间数据中推导真实结论,而非简单跑流程。做生物信息学或AI for Science的团队,值得看看当前模型的表现差距在哪里。
原文
精选全部日报登录