PaperBench 近期进展 PaperBench 是一个用于评估 AI 复制前沿研究能力的基准工具。近期,PaperBench 在 AI 领域的进展备受关注。 阿里开源Qwen3.8-2.4T-A95B:2.4T MoE、激活95B、原生256K上下文 原文标题:阿里近日开源了 Qwen3.8-2.4T-A95B 模型,该模型具有 2.4T MoE、激活 95B 和原生 256K 上下文的能力,为 PaperBench 提供了更强大的评估基础。 Qwen智能体基准成绩:PaperBench达93,OSWorld达86 原文标题:在最新的基准测试中,Qwen 智能体在 PaperBench 上的成绩达到了 93,在 OSWorld 上的成绩达到了 86,显示出其在 AI 复制能力上的显著提升。 PaperBench:评估AI复制前沿研究能力 原文标题:PaperBench 的目标是提供一个全面、客观的评估标准,以衡量不同 AI 模型的复制能力,推动 AI 领域的研究和发展。 当前焦点与观察点 目前,PaperBench 在 AI 复制领域的应用越来越广泛,其基准成绩成为衡量模型性能的重要指标。同时,随着更多模型的加入和测试,PaperBench 也面临着如何保持公平性和准确性的挑战。