00:03Philipp Schmid@_philschmidEvoCode 是一个新评测基准,包含 26 个任务和 227 轮次(每任务 5-15 轮),测试智能体在持续对话中跟随进化需求并保持已有行为的能力。评测采用单一持久容器,每轮后累积测试。常见失败模式不是无法构建新功能,而是实现或更新时破坏了已工作的部分。该评测由 Philipp Schmid 发布。AI模型EvoCode智能体评估基准推荐理由:想知道智能体在多轮对话里会不会越改越烂?EvoCode 用 26 个任务 227 轮测试,专门抓这种翻车现场。原文稍后读已读值得跟进有用关注 EvoCode