行业多源确认

DeepSeek V4.1 Flash 发布后,中美顶尖模型 LiveBench 差距缩至 3%

DeepSeek V4.1 Flash 发力,中美顶尖模型 LiveBench 跑分差距缩至 3%

精选理由

DeepSeek V4.1 Flash 把和 Anthropic 的跑分差距从 15% 追到只剩 3%,想知道中美模型现在差多少的看这篇。

彭博行业研究报告称,DeepSeek 9 月发布 V4.1 Flash 后,中国顶尖模型在基准测试上仅落后美国对手 3%,差距较 5 月的约 9% 和更早的 15% 明显收窄。V4.1 Flash 在 LiveBench 全球排名第六,是 DeepSeek 自 2025 年推理模型 R1 以来排名最高的中国模型,最近得分为 81.1 分,低于 Anthropic 最高的 83.4 分。分析师认为这得益于 AI 专业能力深化和针对国产硬件的模型优化,但 LiveBench 前 15 名中仍只有 3 个中国模型,且排名波动大、模型变现困难。

原文 · IT之家

DeepSeek V4.1 Flash 发力,中美顶尖模型 LiveBench 跑分差距缩至 3%

北京时间 10 月 5 日,据彭博行业研究称,过去几个月,随着 DeepSeek 等中国 AI 实验室的模型不断进步,美国 AI 公司相对中国同行的性能领先优势急剧缩小,降至历史最低水平,这让美国的科技主导地位面临威胁。 DeepSeek 彭博行业研究高级分析师罗伯特 · 利亚 (Robert Lea) 在周一的一份报告中写道,在 DeepSeek 9 月发布 V4.1 Flash 之后,中国顶尖模型在基准测试得分上仅落后美国竞争对手 3%。这一差距较 5 月份的约 9% 和今年早些时候的 15% 有所收窄。 他表示,这种性能的持续提升意味着中国竞争者将进一步扩大市场份额。 彭博指出,中国模型技术的崛起得益于其 AI 专业能力的不断深化,以及研究人员针对国产硬件优化模型的能力。这些进展也让人们开始质疑美国限制技术出口的做法是否有效。 利亚称,中国取得的进展“进一步让人质疑美国在 AI 领域的科技主导地位能否长期维持”。 DeepSeek 的 V4.1 Flash 上月在 LiveBench 全球排名中位列第六,成为自这家创业公司 2025 年凭借其推理模型 R1 取得突破以来排名最高的中国模型。LiveBench 根据 AI 模型对问题、谜题或任务的回答与分析进行评分,这一过程类似于衡量人类智商。 DeepSeek 最近一次在 LiveBench 上的得分为 81.1 分,低于 Anthropic 最高的 83.4 分。利亚表示,这意味着 DeepSeek 模型的表现已经“可以与 Anthropic、OpenAI 的领先 AI 系统相媲美”。不过,尽管双方的得分差距已经缩小至仅 3%,LiveBench 评选出的前 15 个模型中只有 3 个来自中国。 利亚提醒称,这类排名会不断变化,而且无论模型在排行榜上的排名如何,变现都可能很困难。

  • Bindu Reddy10-03 16:54原文
  • kimmonismus10-04 00:01原文
  • Nikkei Asia10-06 16:00原文
  • rohanpaul_ai10-03 03:52原文
  • Amjad Masad10-03 04:19原文
  • Teortaxes10-03 05:21原文
  • The Business Times: Tech10-03 06:15原文
  • The Information10-03 15:00原文
  • Anthropic: Newsroom10-03 18:25原文
  • Decoder10-03 18:56原文