主要来源Thomas Wolf
查看原文事件专题 · 多源确认
Terminal-Bench 扩展至科学领域:T-Bench Science 开放任务贡献
Terminal-Bench 是一个评估 AI 模型在计算机上使用工具(如命令行)达成目标能力的基准。现在它扩展到了科学领域,推出 T-Bench Science,专门评估 AI 在真实科研工作流中的表现。该基准面向生命科学、物理、地球科学、数学等领域的科学家,并开放任务贡献至 2026 年 8 月。贡献的科研工作流越多样,越能推动下一代 AI 模型更好地辅助日常研究工作。这不是训练数据集,而是用于评估前沿模型性能的基准。Anthropic、OpenAI 和 Google DeepMind 已使用 Terminal-Bench 评估 AI 编程能力,现在科学领域也加入其中。
当前结论
做科研的 AI 用户终于有了专门评估 AI 辅助科研能力的基准——T-Bench Science 直接面向真实工作流,科学家可以贡献自己的流程来推动模型进步,值得关注和参与。
11 个信源52° AI 热度最后更新 2026/5/20 17:47:37
证据链
相关来源 1Greg Brockman
查看原文相关来源 2lmarena.ai
查看原文相关来源 3berryxia
查看原文相关来源 4IT之家
查看原文相关来源 5Ethan Mollick
查看原文相关来源 6rohanpaul_ai
查看原文相关来源 7The Rundown AI
查看原文相关来源 8Jerry Liu
查看原文相关来源 9AI Breakfast
查看原文相关来源 10marktechpost
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。