事件专题 · 多源确认

Kimi K3 max vs GPT-5.6 Sol max:DeepSWE基准对比

Together Compute 团队在 DeepSWE 基准上对比了 Kimi K3 max 和 GPT-5.6 Sol max。单次测试 pass@1 中 GPT 为 72.7%,Kimi 为 68.5%;但多次测试中 Kimi 反超,pass@4 达 89.4% 对 GPT 的 85.8%。成本方面 Kimi 约 $4.65/rollout,GPT 约 $8.37;每 $100 预算 Kimi 可解 14.7 题,GPT 仅 5.3 题。语言专长上 Kimi 在 Rust 更强(65-60),GPT 在 Python/TS/JS 更强。两模型任务级相关仅 0.46,组合覆盖率达 95.6%,推荐级联策略:先 Kimi 再 GPT,可达到 85.6% 解题率且成本更低。

当前结论

Together Compute 下了个对比,Kimi 和 GPT 在修 bug 上各有绝活,组合用比单干划算得多。

3 个信源72° AI 热度最后更新 2026/7/24 02:24:02

证据链

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情