AI模型精选

Qwen智能体基准成绩:PaperBench达93,OSWorld达86

Against Qwen3.7 Max, Qwen reports gains across long-horizon and visual agent benchmarks: PaperBench ...

精选理由

Qwen放出了新基准分,PaperBench直接到93,比之前64.8涨了一大截,智能体任务可以关注。

AI 摘要

Qwen在长期任务和视觉智能体基准上报告了新成绩。PaperBench从64.8升至93.0,OSWorld-Verified从73.3升至86.1,Vision2Web从42.1升至69.0。数据由OpenRouter推文转述。

原文 · OpenRouter

Against Qwen3.7 Max, Qwen reports gains across long-horizon and visual agent benchmarks: PaperBench ...

Against Qwen3.7 Max, Qwen reports gains across long-horizon and visual agent benchmarks: PaperBench rises from 64.8 to 93.0, OSWorld-Verified from 73.3 to 86.1, and Vision2Web from 42.1 to 69.0. 💬 1 🔄 0 ❤️ 7 👀 1075 📊 2 ⚡