模型Agent 与开发者多源确认73°07:38Artificial Analysis 推出 Terminal-Bench-Science 0.1 智能体科研基准榜单Stanford 联合 Terminal-Bench 团队搞了个科研智能体榜单,70 个真实科研任务里 GPT-6 Astra 拿 63% 排第一,开源模型才 10%,差距很直观。#Terminal-Bench#GPT-6 Astra#Claude Opus 5.5#GLM-5.310 个信源在谈事件专题官方账号Artificial Analysis@ArtificialAnlys11 个信源在谈原文稍后读已读值得跟进有用关注 Terminal-Bench