6月13日
6月12日
04:35
04:35lmarena.ai@lmarena_ai
Agent Arena 发布了完整的智能体排行榜,涵盖多个 AI 模型的智能体能力评测。该排行榜通过自动化测试评估各模型在任务执行、工具调用等方面的表现,为开发者选择智能体模型提供参考。榜单数据公开可查,支持社区持续关注和对比。
推荐理由:做智能体开发的团队可以直接参考这份排行榜选型,省去自己评测的时间,建议点开看看各模型的具体表现。
6月11日
6月10日
12:51
12:51lmarena.ai@lmarena_ai
Anthropic 的 Claude Fable 5 模型在 Agent Arena 中首次亮相,由 Peter Gostev 进行评测。该视频展示了模型在智能体任务中的表现,包括推理、工具调用和交互能力。Claude Fable 5 被认为在复杂任务处理上有所提升,为开发者提供了新的选择。
事件专题

推荐理由:做智能体开发的团队可以看看 Claude Fable 5 在 Agent Arena 的实际表现,直接对比其他模型,值得点开视频一探究竟。
6月9日
6月7日
00:48
00:48lmarena.ai@lmarena_ai
精选72°
Agent Arena 排行榜发布方法论深度解读,通过因果推断评估模型的智能体性能。排行榜基于五个信号:任务成功率、可操控性、错误恢复能力、用户表扬与投诉比、工具幻觉率。这为评估 AI 智能体能力提供了更全面的框架,帮助开发者理解模型在实际任务中的表现。
推荐理由:做 AI 智能体评估的团队终于有了更科学的参考框架——五个信号覆盖了任务执行和用户体验,值得研究评测方法的开发者点开细看。
6月5日