8月3日
09:54
09:54官方一手pandaily@contact@pandaily.com (Pandaily)
清华团队开源VeriLoop Coder-E1,基于Qwen3.6-27B模型。模型在SWE-bench Verified获得85.20分,SWE-bench Pro为62.38分,Terminal-Bench 2.0达76.40分,DeepSWE为33.63分。该模型采用窄领域PEFT和Self-Harness技术,实现仓库级代码修复的可验证递归自改进。

推荐理由:清华开源了个能自己改代码的模型VeriLoop Coder-E1,SWE-bench拿85.2分,比很多大模型都强,想搞代码修复的可以试试。
7月22日
11:27
11:27官方一手arXiv: DeepSeek@Tianyue Jiang, Yanlin Wang, Xin He, Daya Guo, Jiachi Chen, Ming Wen, Ensheng Shi, Xilin Liu, Yuchi Ma, Guanbin Li
PhoenixRepair是一个多智能体框架,通过多位置采样和迭代反思扩大修复策略搜索空间。在SWE-bench-Verified上,相比SWE-agent在DeepSeek-V3.1下实现7.8%的相对提升。在MiniMax-M2.5下达到76.0% Pass@1的最高解决率。该框架的故障定位准确率也优于现有方法。
推荐理由:新论文的PhoenixRepair能更系统地探索代码修复位置,在SWE-bench上比SWE-agent提升了7.8%,做软件工程的值得一看。
7月10日
22:15
22:15官方账号LMSYS Org (SGLang)@lmsysorg
精选
Netpreme发布博客,介绍将X-Mem MPU插入SGLang HiCache的分层KV缓存方案。在SWE-bench的Claude Code多轮编码中,前缀缓存命中率平均达98%。用X-Mem替换主机DRAM作为卸载层级后,TTFT降低6.7倍,每用户TPS提升33-50%,系统吞吐量提升30%。该方案通过HiCache的分层接口实现即插即用。

推荐理由:Netpreme的X-Mem内存插进SGLang的HiCache,多轮对话缓存带宽不再是瓶颈,TTFT降6.7倍,吞吐量涨30%,实测SWE-bench效果显著。
6月18日
6月11日
11:56
11:56官方账号arXiv cs.LG@Mengyu Zheng, Kai Han, Boxun Li, Haiyang Xu, Yuchuan Tian, Wei He, Hang Zhou, Jianyuan Guo, Hailin Hu, Lin Ma, Chao Xu, Guohao Dai, Lixue Xia, Yunchao Wei, Yunhe Wang, Yu Wang
精选
通用智能体(如OpenClaw)在编程任务上的表现难以用现有SWE-bench准确衡量,因为其不满足Docker工作区、补丁和预测合约要求。为此,研究者推出了Claw-SWE-Bench,一个多语言基准测试和适配器协议,能在固定提示、预算、工作区等公平条件下比较不同智能体框架。该基准包含350个GitHub问题实例,覆盖8种语言和43个仓库,并提供了80实例的轻量版Lite用于快速验证。实验显示,OpenClaw在直接适配器下仅得19.1% Pass@1,而完整适配器可达73.4%,表明适配器设计对编程任务至关重要。该基准将框架和成本作为评估核心维度,数据已开源。
事件专题

推荐理由:做智能体编程评估的团队终于有了公平比较的基准——Claw-SWE-Bench解决了不同框架无法直接对比的痛点,建议做Agent评估的开发者直接用它来测试自己的适配器设计。
6月8日
5月13日
21:35
21:35官方一手Anthropic: Engineering资讯
75°
Anthropic 宣布其 Claude 3.5 Sonnet 模型在 SWE-bench Verified 基准测试中取得了 49.7% 的通过率,较此前最佳成绩提升了约 10 个百分点。该测试评估 AI 模型解决真实 GitHub 问题的能力,包括代码修复、功能实现等。Claude 3.5 Sonnet 在多个类别中表现优异,尤其在需要多步推理和上下文理解的复杂任务上。这一进展表明 AI 在软件工程自动化领域正快速接近人类水平。
事件专题

推荐理由:Claude 3.5 Sonnet 在 SWE-bench 上的突破意味着 AI 编程助手离真正解决复杂工程问题更近了一步,做软件开发的团队可以关注这一能力提升对日常代码修复和功能开发的潜在影响。