事件专题 ·多源确认

Mistral Large 4 在 DeepSWE 基准测试中领先 GLM-5.3

Mistral Large 4 在 DeepSWE 基准测试中得分为 62%,超越 GLM-5.3。该模型在 Finch 金融任务基准测试中得分为 67%,为当前开源模型最佳表现。Le Chonk 在 Harvey 的法律智能体基准测试中得分为 15%。

当前结论

Mistral Large 4 在多个专业领域基准测试中表现优异,金融和法律任务得分亮眼。

11 个信源76° AI 热度最后更新 2026/10/6 13:28:19

证据链

11 个信源
相关来源 3Guillaume Lample (Mistral)
查看原文
相关来源 8Clement Delangue
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。