主要来源OpenAI Blog
查看原文事件专题 · 官方一手
OpenAI 发布 LifeSciBench 基准,评估 AI 处理生命科学研究任务
OpenAI 发布了 LifeSciBench,这是一个由 10 位生命科学专家编写并经过独立审查的基准测试。该基准包含 30 个任务,覆盖文献综述、实验设计、数据分析等真实研究场景。初步测试显示,GPT-4o 在多数任务上优于其他模型,但所有模型在需要跨领域推理的任务中表现仍有显著差距。LifeSciBench 旨在为 AI 在科学领域的可靠性和安全性提供更严格的评估工具。
当前结论
OpenAI 出了个新基准 LifeSciBench,专门测 AI 做生命科学研究的能力,比一般问答难多了,能看出模型哪里不行。
11 个信源41° AI 热度最后更新 2026/6/17 00:00:00
证据链
相关来源 1Decoder
查看原文相关来源 2marktechpost
查看原文相关来源 3@koltregaskes
查看原文相关来源 4Jim Fan
查看原文相关来源 5AI Will
查看原文相关来源 6elvis
查看原文相关来源 7kimmonismus
查看原文相关来源 8IT之家
查看原文相关来源 9berryxia
查看原文相关来源 10Fireworks AI
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。