主要来源Browser Use
查看原文事件专题 ·多源确认
Grok 4.7 浏览器长任务基准 39.9 分,仍落后 DeepSeek
browser_use 官方发布 Long Horizon Browser Use Benchmark v2 榜单,纳入刚发布的 Grok 4.7。Grok 4.7 得分 39.9,高于 Grok 4.6 的 31.2,但不到 GPT-6 Astra 80.6 分的一半。DeepSeek V4.1 Flash 以 47.9 分排第二,领先 Grok 4.7 约 8 分。
当前结论
Grok 4.7 浏览器任务 39.9 分,比上代涨 8.7,但只有 GPT-6 Astra 一半。
9 个信源22° AI 热度最后更新 2026/9/21 20:53:59
证据链
9 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。