模型Agent 与开发者72°17:59DeepSWE 基准发布:113 个任务覆盖 5 种语言,Claude Opus 超 Claude Code 10 个百分点做 SWE 智能体评估或开发 AI 编程助手的团队,这个新基准更贴近真实开发场景,值得关注其设计思路和模型表现差异。#SWE 基准#智能体#编程助手#Claude Opus1 个信源在谈事件专题Philipp Schmid@_philschmid2 个信源在谈原文稍后读已读值得跟进有用关注 SWE 基准