主要来源IT之家
查看原文事件专题 ·多源确认
DeepSeek V4.1 Flash 发布后,中美顶尖模型 LiveBench 差距缩至 3%
彭博行业研究报告称,DeepSeek 9 月发布 V4.1 Flash 后,中国顶尖模型在基准测试上仅落后美国对手 3%,差距较 5 月的约 9% 和更早的 15% 明显收窄。V4.1 Flash 在 LiveBench 全球排名第六,是 DeepSeek 自 2025 年推理模型 R1 以来排名最高的中国模型,最近得分为 81.1 分,低于 Anthropic 最高的 83.4 分。分析师认为这得益于 AI 专业能力深化和针对国产硬件的模型优化,但 LiveBench 前 15 名中仍只有 3 个中国模型,且排名波动大、模型变现困难。
当前结论
DeepSeek V4.1 Flash 把和 Anthropic 的跑分差距从 15% 追到只剩 3%,想知道中美模型现在差多少的看这篇。
11 个信源68° AI 热度最后更新 2026/10/5 00:50:23
证据链
11 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。