论文Agent 与开发者10:22SWE-Serve:评测智能体生产级推理工程能力的新基准做了个基准 SWE-Serve,用 SGLang 的 53 个真实任务测智能体写推理工程代码,发现三分之一的补丁看着过了测试、上线就翻车。#SWE-Serve#SGLang#智能体#推理模型aarXiv cs.AI@Jennifer Williams 等 4 人原文稍后读已读值得跟进有用关注 SWE-Serve