09:33shao__meng@shao__meng78°LoopArena 基准测试解决了编码智能体评测中的盲区,将模型作为管理者的能力从系统能力中剥离单独测量。该基准采用 Controller-Reporter-Worker 三角架构,固定 Worker 为 Qwen3.7-Plus,只评测 Controller 模型的决策能力。实验评测了 5 个模型,包括 GPT-5.5 和 Claude Opus 4.8,结果显示长程循环控制仍然困难,最高成功率仅 24.69%。论文LoopArenaQwen3.7-PlusGPT-5.5推荐理由:LoopArena 基准首次单独测量模型作为'管理者'的能力,发现 GPT-5.5 在长程任务中表现最佳,但成功率仍不足 25%。原文稍后读已读值得跟进有用关注 LoopArena