主要来源marktechpost
查看原文事件专题 · 官方一手
OpenAI发布LifeSciBench,750项任务评估AI模型在生命科学研究中的表现
OpenAI推出LifeSciBench,包含750个专家撰写任务,覆盖7个工作流和7个生物学领域,由173位博士科学家构建,使用19,020条评分标准评估推理与决策。当前最佳模型GPT-Rosalind得分仅36.1%,在人工制品、精确输出和操作决策上仍有较大提升空间。该基准旨在测试AI的真实研究能力而非单纯记忆。
当前结论
想看看AI搞科研到底多强?OpenAI出了个750道专家题的LifeSciBench,GPT-Rosalind才36.1%,差距大到让你吃惊。
11 个信源61° AI 热度最后更新 2026/6/18 02:28:22
证据链
相关来源 1OpenAI
查看原文相关来源 2elvis
查看原文相关来源 3Decoder
查看原文相关来源 4@koltregaskes
查看原文相关来源 5Jim Fan
查看原文相关来源 6IT之家
查看原文相关来源 7berryxia
查看原文相关来源 8Fireworks AI
查看原文相关来源 9宝玉
查看原文相关来源 10AI Will
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。