事件专题 · 单一信源

DeepSWE 基准发布:113 个任务覆盖 5 种语言,Claude Opus 超 Claude Code 10 个百分点

DeepSWE 是一个新的软件工程/智能体基准测试,包含 113 个任务,覆盖 91 个仓库和 5 种编程语言。其评估框架 mini-swe-agent 为每个模型提供单一的 bash 工具和相同的系统指令,没有厂商自定义原语。评估提示比 SWE-Bench Pro 更短,但平均需要修改 5.5 倍以上的代码和 7 个文件,旨在模拟开发者与智能体对话的真实方式。初步结果显示,Claude Opus 比 Claude Code 高 10 个百分点,Gemini 3.1 Pro 比 Gemini CLI 高 20 个百分点。该基准强调指令遵循能力,可能对探索型模型不利。

当前结论

做 SWE 智能体评估或开发 AI 编程助手的团队,这个新基准更贴近真实开发场景,值得关注其设计思路和模型表现差异。

2 个信源72° AI 热度最后更新 2026/5/27 09:17:38

证据链

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情