GeneBench 是一个专为评估人工智能在生物学领域性能而设计的基准测试,由 OpenAI 推出其升级版 GeneBench-Pro,旨在衡量 AI 处理基因组学等生物数据的判断力。该基准通过模拟真实生物学分析任务,测试模型在基因序列解读、变异检测等复杂场景下的表现,成为连接 AI 与生物学应用的重要标尺。
GeneBench 近期进展
OpenAI 在 2025 年 5 月正式发布 GeneBench-Pro 基准,并同期推出 GPT-5.6 系列模型(Sol、Terra、Luna)。OpenAI 发布 GeneBench-Pro 基准测试,考验AI处理生物数据判断力 指出,该基准主要考察 AI 对生物数据因果关系的理解,而非单纯模式匹配。在 Greg Brockman 的演示中,GPT-5.6 Sol 在 GeneBench-Pro 上的生物分析判断任务取得显著进步。OpenAI 发布 GeneBench-Pro 基准,GPT-5.6 Sol 在生物分析判断任务上大幅进步 展示了模型在区分致病突变与良性变异时的准确率提升。IT之家 的报道则强调 GeneBench-Pro 专注于生物学计算能力评估。OpenAI 推出 GeneBench-Pro 基准,专注生物学计算能力评估 详细介绍了基准的设计原则与评分体系。OpenAI 官方博客也同步公开了 GeneBench-Pro 的技术细节与使用指南。GeneBench-Pro:AI基因组学与生物学新基准 说明其涵盖从单基因到多基因交互的多层次任务。
当前焦点与观察点
GeneBench 的推出引发行业对 AI 生物学评估标准的讨论。一方面,GeneBench-Pro 填补了领域内缺乏统一评测方法的空白,其任务设计强调推理能力而非数据记忆,有助于推动模型向真正理解生物学机制发展。另一方面,有观点指出当前基准仍以人类标注数据为参考,可能隐含固有偏见,且复杂任务权重分配是否合理尚待验证。此外,GPT-5.6 系列在 GeneBench-Pro 上的高分表现,引发对模型是否过度拟合基准的担忧。未来,该基准的泛化能力与在真实科研场景的实用性将成为关注焦点。