主要来源shao__meng
查看原文事件专题 ·多源确认
Fireworks 实测:完美路由通过率 97.6%,成本不到最佳单模型 1/3
Fireworks 在 DeepSWE v1.1 上跑了 113 个任务 × 18 个模型 × 每组 4 次 rollout 的交叉测试,共 2034 个"模型-任务"单元。假设每个任务都分给最擅长的模型,通过率从最佳单模型 GPT-6 Astra 的 74.1% 升到 97.6%,每任务成本从 $6.52 降到 $1.88。113 个任务里 94 个的最优选择单价低于 $3,三个 $11.50 以上的顶级模型只在 3 个任务上唯一最优。最佳三模型组合已达 91.2%,从 3 个扩到 18 个只再涨 6.4 个百分点。瓶颈在真实路由器很难逼近这个上界:多个近期路由研究在严格 pass@1 下无法稳定击败简单基线,Fireworks 的 FireRouter 靠缓存感知切换,在 2334 个内部编码会话上把成本从单用 Opus 5 的 $15.81 降到 $7.42。
当前结论
Fireworks 测了 18 个模型:最贵的只在 3 个任务上是唯一最优,路由的想象空间很大。
4 个信源67° AI 热度最后更新 2026/9/22 01:20:55
证据链
4 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。