事件专题 ·多源确认

Nvidia 论文 VERA:模型训练与技能文件交替更新提升智能体长任务表现

Nvidia 发布论文 VERA,针对长链路多步骤智能体任务提出交替更新方案:轮流训练模型和编辑其技能文件,并用真实证据的逐步评分决定每轮修复方向。VERA 构建了超过 9,000 个可重启沙箱,对工作流的每一步对照真实文件和日志打分,而不是只看最终结果。在医学研究基准上,9B 智能体采用两种更新方式后得分 69.1,仅用技能编辑为 56.1,仅用训练为 43.3。论文指出只训练模型或只改 harness 会损失约一半收益。

当前结论

Nvidia 出的 VERA 方法挺实在:训练模型和改技能文件交替来,逐步打分定位哪一步出错,9B 智能体从 43.3 提到 69.1。

11 个信源54° AI 热度最后更新 2026/10/8 18:31:56

证据链

11 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。