同一模型跑 Claude Code、mini-SWE-agent、OpenCode 对比,结论很实用:精简提示词和工具能省最多 3 倍成本,写 Agent 的都该看看。
#SWE-bench Verified
共 10 条 · 7 天 2 条 · 30 天 4 条
信息流里打上「SWE-bench Verified」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月8日
研究表明:换 Agent 框架对结果的影响堪比重跑一次
10月6日
测量优先的智能体排行榜审计框架:污染风险与评分器验证
一群研究者专门审计智能体排行榜的基准污染问题,用 GPT-4.1 和 DeepSeek-V4-Flash 在 SWE-bench 上做了对照实验,结论是很多污染指控证据不足,做评测的人值得看看这套框架。
9月24日
Google 论文提出 RRSI:防止智能体 harness 自动进化过拟合基准
Google 这篇论文值得做 Agent 的人细读:自动优化 harness 会让你 eval 分数涨但真实任务变差,RRSI 用双向正则化解决了这个问题。
9月23日
PACT 论文:对齐 critic 与策略,提升 LLM 强化学习训练效果
一篇把 LLM 强化学习里 credit assignment 讲清楚的论文,PACT 训练后在数学推理上比 GRPO 高 8.8 个点,搞 RL 后训练的值得看看推导。
8月10日
PMCoder:为软件问题修复耦合规划与情景记忆的LLM智能体
PMCoder把规划和记忆绑在一起,SWE-bench Verified上多解25个issue,换Claude或DeepSeek也有效,思路挺巧。
8月4日
7月30日
7月10日
TRACE:智能体识别缺失能力自我改进,Qwen3.6-27B达73.2%
斯坦福AI Lab搞了个新方法TRACE,让AI自己找短板补课。只用四分之一训练量就超过了GRPO和GEPA,还赢了大模型Codex 5.2和GLM 5。
7月7日
论文12:51
CompactionRL:用上下文压缩强化学习训练长程智能体一篇论文提出用强化学习+上下文压缩训练长程智能体,在SWE-bench等基准上显著提升开源模型表现,适合关注Agent训练和RL方法的人。
6月19日
探针-改进调优法提升编码智能体仓库指导效果
这篇论文告诉你:给编码智能体写AGENTS.md时,别一次性写好就完,得用探针-改进法迭代修。实测在SWE-bench上解决率涨了近5个点,主要是能让智能体多搞定14.5%的实例。