Terminal-Bench-Science基准发布

Terminal-Bench-Science is out!

精选理由

斯坦福发布了科研AI代理基准Terminal-Bench-Science,Claude Opus 5仅完成30%,看看你的模型表现如何。

AI 摘要

Terminal-Bench-Science是一个评估AI代理在科研工作流表现的基准测试。该基准由斯坦福大学领导,v0.1版本包含70个任务。Claude Opus 5仅能解决约30%的任务。这是Terminal-Bench团队与全球科研机构科学领域专家共同开发的成果。

原文 · Stanford AI Lab

Terminal-Bench-Science is out!

Terminal-Bench-Science is out! Steven Dillmann @StevenDillmann We're releasing Terminal-Bench-Science: a benchmark for evaluating AI agents on research workflows across scientific domains. An ongoing Stanford-led community effort, built by the team behind Terminal-Bench together with scientific domain experts at research institutions worldwide. v0.1 has 70 tasks. Claude Opus 5 solves only ~30%. 1/n 👇 🔗 View Quoted Tweet 💬 1 🔄 1 ❤️ 14 👀 1551 📊 2 ⚡