PaperBench

general · 首次出现 2026-05-22 · 最近出现 2026-09-03 · 累计提及 8

综述

PaperBench 近期进展

PaperBench 是一个用于评估 AI 复制前沿研究能力的基准工具。近期,PaperBench 在 AI 领域的进展备受关注。

阿里开源Qwen3.8-2.4T-A95B:2.4T MoE、激活95B、原生256K上下文

原文标题:阿里近日开源了 Qwen3.8-2.4T-A95B 模型,该模型具有 2.4T MoE、激活 95B 和原生 256K 上下文的能力,为 PaperBench 提供了更强大的评估基础。

Qwen智能体基准成绩:PaperBench达93,OSWorld达86

原文标题:在最新的基准测试中,Qwen 智能体在 PaperBench 上的成绩达到了 93,在 OSWorld 上的成绩达到了 86,显示出其在 AI 复制能力上的显著提升。

PaperBench:评估AI复制前沿研究能力

原文标题:PaperBench 的目标是提供一个全面、客观的评估标准,以衡量不同 AI 模型的复制能力,推动 AI 领域的研究和发展。

当前焦点与观察点

目前,PaperBench 在 AI 复制领域的应用越来越广泛,其基准成绩成为衡量模型性能的重要指标。同时,随着更多模型的加入和测试,PaperBench 也面临着如何保持公平性和准确性的挑战。

相关报道

4 条在档