事件专题 ·多源确认

Harvey LAB-AA v1.1 加入幻觉检查,Grok 4.7 以 9.4% 登顶法律基准

Artificial Analysis 与 Harvey 联合更新 Legal Agent Benchmark 评分方法,推出 LAB-AA v1.1,新增幻觉检查,只有满足全部评分标准且不含重大幻觉的任务才计入新指标 Hallucination-Gated All-Pass Rate。Grok 4.7(xhigh)以 9.4% 排名第一,Muse Spark 1.3(max)和 GPT-6 Astra(max)分别为 8.9% 和 8.6%。Muse Spark 1.3 在不加幻觉门槛时以 26.7% 领先,但其三分之二的通过结果含重大幻觉;GPT-6 Astra 在 120 个任务中平均每次任务仅 0.03 个重大幻觉,Gemini 3.8 Flash(high)则高达 13.96 个。成本方面,榜首的 Grok 4.7 每任务约 9.50 美元,不到最贵的 Claude Fable 5.1(约 21.70 美元)的一半。

当前结论

法律基准加了幻觉门槛后排名大洗牌:Muse Spark 本来领先,过滤幻觉后掉到第二,GPT-6 Astra 几乎不缩水。看各家法律任务幻觉差距挺有意思。

11 个信源54° AI 热度最后更新 2026/10/8 18:33:38

证据链

11 个信源
主要来源Artificial Analysis
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。