事件专题 · 多源确认

OpenAI 推出 GeneBench-Pro 基准,专注生物学计算能力评估

OpenAI 发布 GeneBench-Pro 基准测试,用于评估 AI 模型在生物学计算中的真实研究能力。该基准包含 129 道题目,覆盖基因组学、定量生物学等 10 大领域和 21 子领域。每道题提供接近真实科研环境的数据集,要求模型自主探索、选择分析方法并给出答案。OpenAI 采用合成数据避免评分偏差,确保模型真正理解问题而非走捷径。目前已在 Hugging Face 开源 10 道示例题,后续将开放 50 道题给 Artificial Analysis 第三方评测。

当前结论

想测测 AI 在生物学研究里的实战能力?OpenAI 搞了个 GeneBench-Pro 基准,129 道题,合成数据防作弊,快看看你的模型能得几分。

11 个信源68° AI 热度最后更新 2026/7/1 14:53:23

证据链

相关来源 10Marc Andreessen
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情