事件专题 ·多源确认

Grok 4.7 浏览器长任务基准 39.9 分,仍落后 DeepSeek

browser_use 官方发布 Long Horizon Browser Use Benchmark v2 榜单,纳入刚发布的 Grok 4.7。Grok 4.7 得分 39.9,高于 Grok 4.6 的 31.2,但不到 GPT-6 Astra 80.6 分的一半。DeepSeek V4.1 Flash 以 47.9 分排第二,领先 Grok 4.7 约 8 分。

当前结论

Grok 4.7 浏览器任务 39.9 分,比上代涨 8.7,但只有 GPT-6 Astra 一半。

9 个信源22° AI 热度最后更新 2026/9/21 20:53:59

证据链

9 个信源
相关来源 5eric zakariasson
查看原文
相关来源 7歸藏(guizang.ai)
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。