AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

LoopArena

共 1 条相关 AI 资讯
9月1日
09:33
09:33shao__meng@shao__meng
78°
LoopArena 基准测试解决了编码智能体评测中的盲区,将模型作为管理者的能力从系统能力中剥离单独测量。该基准采用 Controller-Reporter-Worker 三角架构,固定 Worker 为 Qwen3.7-Plus,只评测 Controller 模型的决策能力。实验评测了 5 个模型,包括 GPT-5.5 和 Claude Opus 4.8,结果显示长程循环控制仍然困难,最高成功率仅 24.69%。
论文LoopArenaQwen3.7-PlusGPT-5.5

推荐理由:LoopArena 基准首次单独测量模型作为'管理者'的能力,发现 GPT-5.5 在长程任务中表现最佳,但成功率仍不足 25%。
原文
精选全部日报登录