11:34shao__meng@shao__meng72°Together Compute 团队在 DeepSWE 基准上对比了 Kimi K3 max 和 GPT-5.6 Sol max。单次测试 pass@1 中 GPT 为 72.7%,Kimi 为 68.5%;但多次测试中 Kimi 反超,pass@4 达 89.4% 对 GPT 的 85.8%。成本方面 Kimi 约 $4.65/rollout,GPT 约 $8.37;每 $100 预算 Kimi 可解 14.7 题,GPT 仅 5.3 题。语言专长上 Kimi 在 Rust 更强(65-60),GPT 在 Python/TS/JS 更强。两模型任务级相关仅 0.46,组合覆盖率达 95.6%,推荐级联策略:先 Kimi 再 GPT,可达到 85.6% 解题率且成本更低。AI模型Kimi K3 maxGPT-5.6 Sol maxDeepSWE2 个信源在谈事件专题推荐理由:Together Compute 下了个对比,Kimi 和 GPT 在修 bug 上各有绝活,组合用比单干划算得多。原文稍后读已读值得跟进有用关注 Kimi K3 max