主要来源elvis
查看原文事件专题 ·多源确认
Composio 评测 6 款模型跑 30 项智能体任务,Pareto 26.9 以 1/3 成本并列第一
Composio 对 GPT-6 Astra、Opus 5.5、GPT-6 Sol、Pareto 26.9、DeepSeek V4 Pro 和 GLM 5.3 Flash 共 6 款模型进行了 30 项智能体任务评测。Pareto 26.9 由 TheUnbiasedCo 推出,会把请求同时发给多个前沿和开源模型并保留最佳答案,最终与 GPT-6 Astra 并列第一,每个成功任务的成本约为其 1/3。GPT-6 Sol 得分与 Opus 5.5 持平,速度更快,成本约为其 1/4。Pareto 26.9 的完成速度也超过 DeepSeek V4 Pro 和 GLM 5.3 Flash。
当前结论
有人把多个模型混着调用,30 个智能体任务测下来追平 GPT-6 Astra,成本只要 1/3,混合路由这事有数据了。
11 个信源73° AI 热度最后更新 2026/9/24 19:05:29
证据链
11 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。