主要来源IT之家
查看原文事件专题 · 多源确认
OpenAI 推出 GeneBench-Pro 基准,专注生物学计算能力评估
OpenAI 发布 GeneBench-Pro 基准测试,用于评估 AI 模型在生物学计算中的真实研究能力。该基准包含 129 道题目,覆盖基因组学、定量生物学等 10 大领域和 21 子领域。每道题提供接近真实科研环境的数据集,要求模型自主探索、选择分析方法并给出答案。OpenAI 采用合成数据避免评分偏差,确保模型真正理解问题而非走捷径。目前已在 Hugging Face 开源 10 道示例题,后续将开放 50 道题给 Artificial Analysis 第三方评测。
当前结论
想测测 AI 在生物学研究里的实战能力?OpenAI 搞了个 GeneBench-Pro 基准,129 道题,合成数据防作弊,快看看你的模型能得几分。
11 个信源68° AI 热度最后更新 2026/7/1 14:53:23
证据链
相关来源 1OpenAI
查看原文相关来源 2Greg Brockman
查看原文相关来源 3Epoch AI
查看原文相关来源 4@koltregaskes
查看原文相关来源 5berryxia
查看原文相关来源 6pandaily
查看原文相关来源 7小互
查看原文相关来源 8@OpenAIDevs
查看原文相关来源 9The Rundown AI
查看原文相关来源 10Marc Andreessen
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。