主要来源TestingCatalog
查看原文事件专题 ·多源确认
Mistral Large 4 在 DeepSWE 基准测试中领先 GLM-5.3
Mistral Large 4 在 DeepSWE 基准测试中得分为 62%,超越 GLM-5.3。该模型在 Finch 金融任务基准测试中得分为 67%,为当前开源模型最佳表现。Le Chonk 在 Harvey 的法律智能体基准测试中得分为 15%。
当前结论
Mistral Large 4 在多个专业领域基准测试中表现优异,金融和法律任务得分亮眼。
11 个信源76° AI 热度最后更新 2026/10/6 13:28:19
证据链
11 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。