全部 AI 动态 · AI 热点

6月16日

20:46

AITOP6月16日 20:46

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

6月14日

17:09

17:09

Decoder@Jonathan Kemper

精选

一项新研究显示，Claude Code和Codex等AI编程助手在定位文件时准确率较高，但会错过文件中大部分关键代码行。新发布的SWE-Explore基准首次将代码搜索与修复步骤分离测试，发现缺乏足够上下文时，即使最佳修复也会失败。该基准评估了多个模型，结果显示它们平均只能找到约30%的关键行。这表明AI编码代理在精确理解代码逻辑方面仍有显著短板。

论文 Claude Code Codex SWE-Explore 编程助手代码搜索

推荐理由：AI编程助手找不准关键行

6月12日

12:57

AITOP6月12日 12:57

Claude代码里藏了个20260612，18个月后的AI记忆革命已经开始倒计时

6月11日

15:28

AITOP6月11日 15:28

1107 vs 303：谷歌悄悄开源了一个“拆打字机”的模型，把大模型速度翻了4倍

15:23

AITOP6月11日 15:23

DiffusionGemma颠覆文本生成？自回归模型的“统治”要结束了

15:07

AITOP6月11日 15:07

每秒1107个token，Google开源的扩散模型为什么能改变本地推理格局？

6月10日

01:18

01:18

AK@_akhaliq

SWE-Explore 是一个新发布的基准测试，专门用于评估 AI 编程代理在代码仓库中的探索能力。该基准测试衡量代理如何理解仓库结构、定位相关文件以及获取上下文信息，这对于解决复杂编程任务至关重要。它填补了现有基准测试只关注最终代码生成而忽略探索过程的空白。开发者可以使用 SWE-Explore 来测试和改进他们的编程代理在大型代码库中的导航和推理能力。

论文编程代理基准测试仓库探索 SWE-Explore AI编程

推荐理由：SWE-Explore 解决了编程代理在真实仓库中“迷路”的痛点，做 AI 编程工具或智能体的团队可以直接用它来评估和优化代理的探索能力，值得关注。