06:08elvis@omarsar0精选新基准对比了 6 个大型推理模型在两种真实 agent harness 上的表现。同一模型、同一任务和提示词,换一个 harness 后单次成功成本可相差 5 到 30 倍。实验包含 24 个带隐藏评估器的确定性编码任务和 4,643 次有效运行。让模型自行开发并比较多种方案会使推理 token 增加 2.4 到 7.4 倍且无正确性提升;泛泛的 think-deeply 提示再增加 1.6 到 2.2 倍。采用限定范围、验收标准和停止条件的模板可做到成本中性,有时将推理消耗减半。论文Agent Harness智能体推理模型推荐理由:别急着换模型,先看看 agent harness。同一任务成功成本能差 5 到 30 倍,论文还给了省 token 的提示模板。原文稍后读已读值得跟进有用关注 Agent Harness