事件专题 ·多源确认

DeepSeek V4.1 Flash 发布后,中美顶尖模型 LiveBench 差距缩至 3%

彭博行业研究报告称,DeepSeek 9 月发布 V4.1 Flash 后,中国顶尖模型在基准测试上仅落后美国对手 3%,差距较 5 月的约 9% 和更早的 15% 明显收窄。V4.1 Flash 在 LiveBench 全球排名第六,是 DeepSeek 自 2025 年推理模型 R1 以来排名最高的中国模型,最近得分为 81.1 分,低于 Anthropic 最高的 83.4 分。分析师认为这得益于 AI 专业能力深化和针对国产硬件的模型优化,但 LiveBench 前 15 名中仍只有 3 个中国模型,且排名波动大、模型变现困难。

当前结论

DeepSeek V4.1 Flash 把和 Anthropic 的跑分差距从 15% 追到只剩 3%,想知道中美模型现在差多少的看这篇。

11 个信源68° AI 热度最后更新 2026/10/5 00:50:23

证据链

11 个信源
相关来源 7The Business Times: Tech
查看原文
相关来源 9Anthropic: Newsroom
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。