17:09Decoder@Jonathan Kemper精选一项新研究显示,Claude Code和Codex等AI编程助手在定位文件时准确率较高,但会错过文件中大部分关键代码行。新发布的SWE-Explore基准首次将代码搜索与修复步骤分离测试,发现缺乏足够上下文时,即使最佳修复也会失败。该基准评估了多个模型,结果显示它们平均只能找到约30%的关键行。这表明AI编码代理在精确理解代码逻辑方面仍有显著短板。论文Claude CodeCodexSWE-Explore编程助手代码搜索推荐理由:AI编程助手找不准关键行原文
01:18AK@_akhaliqSWE-Explore 是一个新发布的基准测试,专门用于评估 AI 编程代理在代码仓库中的探索能力。该基准测试衡量代理如何理解仓库结构、定位相关文件以及获取上下文信息,这对于解决复杂编程任务至关重要。它填补了现有基准测试只关注最终代码生成而忽略探索过程的空白。开发者可以使用 SWE-Explore 来测试和改进他们的编程代理在大型代码库中的导航和推理能力。论文编程代理基准测试仓库探索SWE-ExploreAI编程推荐理由:SWE-Explore 解决了编程代理在真实仓库中“迷路”的痛点,做 AI 编程工具或智能体的团队可以直接用它来评估和优化代理的探索能力,值得关注。原文