精选理由
想测测你的 AI 编程助手在多语言重构上到底行不行?这个新基准 SWE-Bench ProMax 就是干这个的,比原来的 SWE-Bench 更狠。
SWE-Bench ProMax 是一个新基准,用于评估 AI 智能体在大规模多语言代码重构任务上的表现。该基准基于 SWE-Bench 扩展,覆盖多种编程语言,任务规模更大。论文已在 Hugging Face 发布,旨在测试智能体处理复杂重构的能力。初步数据显示,现有模型在该基准上仍有较大提升空间。
原文 · AK
SWE-Bench ProMax Benchmarking Agents on Large-Scale Multilingual Code Refactoring paper: https://t...
SWE-Bench ProMax Benchmarking Agents on Large-Scale Multilingual Code Refactoring paper: huggingface.co/papers/2608.09… 💬 3 🔄 2 ❤️ 12 👀 3377 📊 5 ⚡