实测多 Agent 调度场景:gpt-sol-6.1 被指远逊 opus-5.5
精选理由
有人拿 gpt-sol-6.1 和 opus-5.5 在多 Agent 调度里当主控对比,差距大到离谱,做编排的可以参考下。
用户 lxfater 在 X 上分享了一次真实多 Agent 调度环境的对比结果。在其测试中,gpt-sol-6.1 担任主控时表现不佳,与 opus-5.5 存在明显差距。该结论来自单一个案体验,未附具体任务细节或基准数据。
原文 · Lxfater
真实的多 Agent 调度当主控的环境下,gpt-sol-6.1 给 opus-5.5 提鞋的资格都没有