一张图对比 Opus 5.5 与 GPT 6 的 Benchmark 成绩
有人把 Opus 5.5 和 GPT 6 的跑分放在一张图里了,重点看 Terminal-Bench 4.0,GPT 在跨应用自动化那项表现很猛。
一条推文整理了 Opus 5.5 和 GPT 6 对外展示的 Benchmark 成绩对比图。Terminal-Bench 4.0 被认为含金量较高,作者指出每代模型分数平滑上升通常是优质模型的特征,说明没有针对基准刷题。GPT 在 AutomationBench 上成绩突出,能够跨多个应用完成任务,作者猜测 Computer Use 能力可能起了作用。
一张图看懂最近Opus 5.5 和 GPT 6 对外展示成绩的Benchmark。 Terminal-Bench 4.0含金量有点高,如果每代模型分数平滑上升,往往是优质模型的特征之一。(说明没刷题) GPT 在 AutomationBench 上成绩非常好,跨多个应用搞定,可能Computer Use立功了? 💬 2 🔄 0 ❤️ 2 👀 1295 📊 2 ⚡