#SWE-bench

共 42 条 · 7 天 10 条 · 30 天 21 条
信息流里打上「SWE-bench」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月10日
10月9日
10月8日
10月6日
10月5日
10月4日
10月2日
10月1日
9月30日
9月29日
9月28日
9月23日
9月16日
9月11日
9月9日
9月3日
9月2日
8月28日
8月7日
8月4日
8月3日
7月31日
7月22日
7月14日
论文Agent 与开发者多源确认09:11
限制编码代理执行代码工具何时有帮助?跨制度和代理设计的消融研究

这篇论文用Claude Code和OpenAI Codex CLI做对比实验发现,多数情况下只让AI用代码执行工具反而更便宜,还不影响成功率。只有Claude在SWE-bench上略贵一点点。想省API成本可以看看。

事件专题
arXiv: OpenAI@Hong Yang 等 3 人11 个信源在谈原文
7月10日
7月8日
6月29日
6月18日
6月13日
6月11日
Claw-SWE-Bench:评估OpenClaw风格智能体编程能力的基准

做智能体编程评估的团队终于有了公平比较的基准——Claw-SWE-Bench解决了不同框架无法直接对比的痛点,建议做Agent评估的开发者直接用它来测试自己的适配器设计。

事件专题
arXiv cs.LG@Mengyu Zheng 等 16 人2 个信源在谈原文
6月9日
6月8日