英伟达 Nemotron 3 Ultra 在 Deep Agents 基准获开源模型最高准确率

推理成本仅为顶级闭源模型的 1/10:英伟达 Nemotron 3 Ultra 获开源模型最高准确率

精选理由

英伟达开源模型 Nemotron 3 Ultra 在智能体测试中准确率最高,成本只有闭源模型的十分之一,适合想低成本构建企业智能体的团队。

AI 摘要

英伟达宣布其 Nemotron 3 Ultra 模型在 LangChain 的 Deep Agents 基准测试中取得开源模型最高准确率。该基准测试评估智能体系统的多步推理、工具调用和任务编排能力。调优后的 Nemotron 3 Ultra 每次推理成本仅为顶级闭源模型的 1/10,同时实现更高吞吐量。在业务任务能力上,该模型通过优化模型周围环境达到顶尖闭源模型水平。

原文 · IT之家

推理成本仅为顶级闭源模型的 1/10:英伟达 Nemotron 3 Ultra 获开源模型最高准确率

IT之家 7 月 9 日消息,英伟达昨日(7 月 8 日)发布博文,宣布在 LangChain 的 Deep Agents benchmark(深度智能体基准)测试中,旗下 NVIDIA Nemotron 3 Ultra 取得开源模型最高准确率。 IT之家注:Deep Agents 是具备多步推理、调用外部工具、访问记忆并在运行时执行复杂任务的智能体系统。它不只回答问题,还可在既定权限内完成操作流程,常用于企业工作流自动化、信息检索、任务编排与跨系统协作等场景。 英伟达表示本次测试的核心在于成本和吞吐量,调优后的 Nemotron 3 Ultra 每次运行的推理成本为领先闭源模型的 1/10,在开源模型中实现了最高的准确率,同时以更高的吞吐量完成了更多任务。 在业务任务能力方面,英伟达 Nemotron 3 Ultra 模型通过优化模型周围环境,达到了顶尖闭源模型的水平。 LangChain 联合创始人兼首席执行官 Harrison Chase 表示: 构建更优秀智能体的关键在于不断改进模型周围的系统。当团队能够协同调整内存、工具使用、评估和模型行为时,这些因素都会产生叠加效应。 我们与 NVIDIA 的合作表明,企业可以利用开放技术栈获得强大的性能,同时还能掌控他们正在构建的智能体系统。