12:58AK@_akhaliq精选SWE-Bench ProMax 是一个新基准,用于评估 AI 智能体在大规模多语言代码重构任务上的表现。该基准基于 SWE-Bench 扩展,覆盖多种编程语言,任务规模更大。论文已在 Hugging Face 发布,旨在测试智能体处理复杂重构的能力。初步数据显示,现有模型在该基准上仍有较大提升空间。论文SWE-Bench ProMax代码重构智能体推荐理由:想测测你的 AI 编程助手在多语言重构上到底行不行?这个新基准 SWE-Bench ProMax 就是干这个的,比原来的 SWE-Bench 更狠。原文稍后读已读值得跟进有用关注 SWE-Bench ProMax