论文精选

Mozilla报告:中美AI模型能力差距缩短至4.4个月

Mozilla 报告:中美 AI 模型能力差距缩短至 4.4 个月

精选理由

Mozilla的报告挺有意思,对比了中美AI模型的差距,还具体提到了Kimi K3和Fable 5,以及它们在成本和任务处理时长上的差异。

Mozilla发布第二版《开源AI现状》报告,指出中国公司最佳开放权重模型与美国科技公司前沿闭源模型的性能差距已缩至4.4个月。相比7月首版报告,新版报告将宏观判断落到了具体模型、具体任务时长和单任务成本上。维度上,顶级开放模型与ChatGPT、Claude等专有模型的性能差距为3%,而美国前沿闭源模型与中国最佳开放权重模型的差距为4.4个月。成本方面,GPT-4级推理成本3年下降至50分之一,Kimi K3成本为Fable 5的30%,GLM 5.2单任务成本约低至5分之一。在能力范围方面,METR以模型可靠完成任务的时长衡量,最佳闭源模型可完成的任务时长是最佳开放模型的1.7倍,开放模型可处理7小时任务,闭源模型可处理约12小时任务。

原文 · IT之家

Mozilla 报告:中美 AI 模型能力差距缩短至 4.4 个月

IT之家 9 月 16 日消息,Mozilla 昨日(9 月 15 日)发布第二版《开源 AI 现状》报告,报道称中国公司最佳开放权重模型与美国科技公司的前沿闭源模型, 能力差距已缩至 4.4 个月。 相比较今年 7 月发布的第一版《开源 AI 现状》报告,第二版报告把宏观判断进一步落到了具体模型、具体任务时长和单任务成本上。 维度 7 月首版 9 月新版 主要变化 能力差距 顶级开放模型与 ChatGPT、Claude 等专有模型的性能差距为 3% 美国前沿闭源模型与中国最佳开放权重模型的差距为 4.4 个月 从单一综合性能百分比,改为更贴近实际工作的“任务时长”指标。 成本表述 GPT-4 级推理成本 3 年下降至 50 分之一 Kimi K3 成本为 Fable 5 的 30%;GLM 5.2 单任务成本约低至 5 分之一 新版给出模型对模型、任务对任务的直接成本对照。 使用数据 79% 开发者使用开放模型,51% 已部署生产;闭源模型生产部署率为 63% 2026 年 8 月 OpenRouter 按令牌量前 10 模型中,8 个提供开放权重 重点由开发者调研转向最新平台使用量排名。 收入数据 开放模型承担约三分之一实际 AI 使用量,但只获得 4% 收入 重申开放模型收入占 4%、闭源占 96%,并注明数据覆盖 2025 年 5 月至 9 月 新版补足了该收入结论的数据时间范围和闭源收入占比。 第二版报告重点提及了月之暗面的 Kimi K3 模型,在 Artificial Analysis 智能指数上的得分仅比 Anthropic 的 Fable 5 低三分,而成本却仅为后者的约 30%。 在能力范围方面,METR 以模型可靠完成任务的时长衡量“时间范围”,可靠成功率标准为 50%。目前,最佳闭源模型可完成的任务时长,是最佳开放模型的 1.7 倍。开放模型可处理 7 小时任务,闭源模型可处理约 12 小时任务。 Mozilla 首席技术官 Raffi Krikorian 将这一差异定性为取决于具体任务场景:闭源模型的溢价主要体现在需要 8 到 12 小时才能完成的专业型任务上,而开源模型则能以极低的价格处理日常工作。 Krikorian 称,4 个月后开放模型可处理 12 小时任务,闭源模型可处理约 20 小时任务。目前,8 至 12 小时任务通常仍是闭源模型可完成、开放模型尚难处理的区间。 这一转变已经开始重塑企业的使用行为。DoorDash 目前已采用 Kimi 处理日常任务,同时将 Fable 保留用于更复杂的工作。2026 年 8 月,路由平台 OpenRouter 上按 token 用量排名前十的模型中,有八个为开源模型。 IT之家附上参考地址 点此前往阅读第二版《开源 AI 现状》 相关阅读: 《 Mozilla 发布 2026 开源 AI 报告:DeepSeek V4 Flash 全球月用量 18.4T Tokens 登顶 》