模型

Claude Opus 5.5 在 FrontierCode 基准上:med 与 max 思考档位得分反而最高

Claude Opus 5.5 在 Agentic coding: FrontierCode 下不同思考程度下的得分 low 是确实不行,med 和 max 居然非常接近,高于 high 和 xhi...

精选理由

Claude Opus 5.5 在 FrontierCode 编程基准上,思考档位调到 med 和 max 成绩差不多,还比 high 高,省钱党可以看下再选档位。

有人实测 Claude Opus 5.5 在 Agentic coding 基准 FrontierCode 上不同思考程度(thinking level)的得分。low 档表现确实不行,而 med 和 max 两档得分非常接近,反而高于 high 和 xhigh 两档。这说明更高思考预算在该编程基准上并不带来线性提升,中间档位可能已是性价比最优选择。

原文 · shao__meng

Claude Opus 5.5 在 Agentic coding: FrontierCode 下不同思考程度下的得分 low 是确实不行,med 和 max 居然非常接近,高于 high 和 xhi...

Claude Opus 5.5 在 Agentic coding: FrontierCode 下不同思考程度下的得分 low 是确实不行,med 和 max 居然非常接近,高于 high 和 xhigh 😂 💬 1 🔄 0 ❤️ 1 👀 333 📊 1 ⚡