#SWE-bench
JetBrains 开源了编程模型 Mellum2.1,Apache 2.0 协议随便商用,SWE-bench Verified 干到 47 分,跑智能体可以试试。
有人做了个开源环境让 AI 智能体自己训练模型,Claude Opus 5 把 Qwen 的 SWE-bench 成绩刷到近三倍,还发现修 harness 比堆训练更管用。
Reflection 的 Beam 开源在即,501B 参数只激活 23B,SWE-bench Verified 拿到 80.9 分,效率号称比 GLM 5.2 高 3-4 倍,写代码跑智能体的可以盯一下。
DeepSeek V4 Flash 加自改 harness,花 4 美元搜索就在 Terminal-Bench 上追平 Codex,SWE-bench 还省了近四成开销,做智能体的都该看看。
Qwen3.5-4B 只靠写复盘解释做微调,不用奖励模型就在 SWE-bench 上跑赢 GRPO,做智能体训练的可以看看这套 ROFT 流程。
跑 Agent 最怕 token 预算失控,这篇论文的 TokenCast 能边执行边预测消耗,实测省 21.3% 的 token,做 agent 的都该看看。
一群研究者认真测了文档到底能不能帮 coding agent,结果在 10 个仓库上翻车,还公开了打分基准和提示词,做 agent 的人该看看这个负面结果。
DeepSeek 把训 Agent 最难的环境基建摊开讲了:每秒造 5000 个沙盒怎么做到,容器、虚拟机、镜像加载的全套工程细节都在论文里。
Claude 的开发者测试数据,能帮你了解不同模型在真实场景下的表现,比如 token 和 step 的消耗情况。
想给智能体造训练任务?CalibForge 让多个求解器互相挑毛病来调任务难度,比人工标靠谱,Terminal-Bench 上能涨二十多个点。
arXiv 新论文做了个 Ledger 层,给编码智能体记账执行状态。GPT-5 mini 在 SWE-bench 从 56.2% 提到 64.2%,成本降 28.9%。
清华开源了个能自己改代码的模型VeriLoop Coder-E1,SWE-bench拿85.2分,比很多大模型都强,想搞代码修复的可以试试。
做代码基准测试的朋友可以看看,PAIChecker能自动揪出PR和Issue配错的情况,SWE-bench上准确率超九成。
新论文的PhoenixRepair能更系统地探索代码修复位置,在SWE-bench上比SWE-agent提升了7.8%,做软件工程的值得一看。
这篇论文用Claude Code和OpenAI Codex CLI做对比实验发现,多数情况下只让AI用代码执行工具反而更便宜,还不影响成功率。只有Claude在SWE-bench上略贵一点点。想省API成本可以看看。
Netpreme的X-Mem内存插进SGLang的HiCache,多轮对话缓存带宽不再是瓶颈,TTFT降6.7倍,吞吐量涨30%,实测SWE-bench效果显著。
官方团队分享了两种省钱的混搭模式:用便宜的Sonnet 5跑大部分任务,偶尔让贵的Fable 5把把关,性能损失不大但预算砍半。
GitHub 实测了 Copilot 智能体框架,五个基准上不输原生,还省 token,支持 20 多种模型,值得试试。
做智能体编程评估的团队终于有了公平比较的基准——Claw-SWE-Bench解决了不同框架无法直接对比的痛点,建议做Agent评估的开发者直接用它来测试自己的适配器设计。
做 AI 自我改进研究的团队终于有了可对照的评估框架——DGM 的 80 轮迭代提升数据值得参考,建议用 MetaAI-Mini 协议复现验证。
这篇论文戳破了 AGENTS.md 的神话——自动生成不仅没用还更贵,手写提升也有限。做 Coding Agent 工具或维护大型仓库的团队,看完会重新评估是否值得投入 context file。
Socratic-SWE 解决了智能体训练数据依赖人工标注的瓶颈,做 AI 编程或智能体开发的团队可以直接借鉴其闭环进化思路,提升模型在真实仓库中的修复能力。