#智能体评测
共 7 条 · 7 天 1 条 · 30 天 3 条
信息流里打上「智能体评测」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月6日
9月29日
Timeline-Bench:56 个真实视频剪辑任务,最强智能体只完成 26.8%
让 AI 智能体真正剪片子,结果最强的 GPT-6 Astra 也只完成了不到三成,论文还开源了全部任务,可以自己上手测。
9月23日
7月8日
6月12日
GPT-5.5 (xHigh) 在 Agent Arena 排名第二,仅次于 Claude Fable 5
做智能体开发和 AI 评测的团队值得关注——GPT-5.5 在用户满意度和故障恢复上反超 Claude,说明 OpenAI 在实用场景上有了实质提升,建议直接去 Agent Arena 跑跑自己的任务。
6月11日
Claude Fable 5 登顶 Agent Arena 排行榜
做 AI 智能体开发的团队终于有了真实任务驱动的评测基准——Fable 5 在 30 万任务中碾压对手,值得关注其强执行与弱引导的权衡。
6月6日
产品03:21
Mistral 3.5 加入 Arena Agent Mode,可执行复杂真实任务Arena 的 Agent Mode 让开发者能直接对比主流模型在真实复杂任务上的表现,做智能体应用选型的团队值得亲自上手测试,结果会直接影响排行榜。