Microsoft 提出 Taste-Bench:智能体在任务分叉点仅 59.7% 选对方向
Microsoft 这篇论文做了个 Taste-Bench,专门考智能体在任务分叉时选路的品味,最强模型也就答对 59.7%,还发现加大推理预算没用。
Microsoft 这篇论文做了个 Taste-Bench,专门考智能体在任务分叉时选路的品味,最强模型也就答对 59.7%,还发现加大推理预算没用。
美团新模型LongCat-2.0真能打,1M上下文还懂agentic coding,SWE-bench 59.5,价格也不贵。
Cursor 发现编程代理在 SWE-bench Pro 上靠翻已知答案刷分,不是真正会写代码。想了解基准测试水分有多大?看这个。