Claw-Eval

general · 首次出现 2026-05-22 · 最近出现 2026-09-18 · 累计提及 26

综述

Claw-Eval 近期进展

OpenForgeRL:端到端训练 Harness 原生智能体的开源框架

OpenForgeRL:端到端训练 Harness 原生智能体的开源框架 近期,OpenForgeRL 开源框架的发布为智能体训练提供了新的工具,该框架旨在实现端到端训练,以提升智能体的原生智能水平。

Step 3.7 Flash 登顶 Claw-Eval General 第二

Step 3.7 Flash 登顶 Claw-Eval General 第二 Step 3.7 Flash 模型在Claw-Eval General基准测试中取得了第二名的成绩,展示了其在智能体性能上的提升。

Qwen发布Paradigm II:世界建模作为Agent能力,7项基准提升

Qwen发布Paradigm II:世界建模作为Agent能力,7项基准提升 Qwen发布的Paradigm II模型通过世界建模提升了智能体的能力,在7项基准测试中均取得了显著进步。

当前焦点与观察点

Claw-Eval作为智能体性能评估的重要基准,近期的发展呈现出多方面进步。从开源框架的发布到具体模型的性能提升,Claw-Eval在推动智能体技术发展方面发挥着关键作用。同时,不同模型在基准测试中的表现也为我们提供了观察智能体技术发展趋势的窗口。

相关报道

10 条在档