7月1日
14:29
14:29官方账号Greg Brockman@gdb
83°
OpenAI 推出 GeneBench-Pro,一个用于评估 AI 在计算生物学中处理判断密集型分析能力的基准。其问题需要人类专家 20-40 小时完成。GPT-5.6 Sol 在该基准上实现了显著提升,标志着模型在混乱生物数据中导航、选择分析路径和做出专业判断方面的进步。
事件专题

推荐理由:OpenAI 搞了个新基准 GeneBench-Pro,专门测模型做复杂生物分析时的判断力,GPT-5.6 Sol 表现很亮眼,比之前强不少。
02:08
02:08官方账号OpenAI@OpenAI
精选
OpenAI推出GeneBench-Pro,这是一个面向AI agent的研究级基准测试。该基准要求agent在混乱的生物数据中导航并选择正确的分析路径。它旨在衡量AI在真实计算研究中的判断能力,而非简单准确率。
事件专题

推荐理由:想看看AI分析生物数据能多聪明?OpenAI这个新测试专考agent的判断力,挺有意思的。
01:07
01:07官方一手OpenAI Blog博客/媒体
GeneBench-Pro是一个新发布的基准测试,用于评估AI在基因组学、生物学和科学研究中的性能。该基准使用复杂真实世界数据集,涵盖多种科学任务。它旨在衡量模型在基因分析和生物信息学方面的能力。
事件专题

推荐理由:GeneBench-Pro用真实数据测AI在基因组学上的表现,搞科研的可以看看到底谁更强。