12:32官方账号arXiv cs.LG@Fanzhe Meng, Guoxin Chen, Jiale Zhao, Shuang Sun, Zhiyu Lin, Wayne Xin Zhao, Ruihua Song, Ji-Rong Wen, Kai JiaCalibForge 是一种自动终端任务合成系统,利用验证过的求解器行为,通过对抗性求解器校准来修订候选任务。多求解器校准针对异构求解器池的分歧,对比求解器校准则针对强通过/弱失败关系。该系统构建了5,431个校准终端任务。在Terminal-Bench 2.0上,基于完整集合训练的模型达到32.58%和47.57%的成绩。相比基础模型,最大提升分别达24.71个百分点(Terminal-Bench 2.0)、27.68个百分点(SWE-bench Pro)和30.04个百分点(Doc2Repo)。论文CalibForgeTerminal-BenchSWE-bench推荐理由:想给智能体造训练任务?CalibForge 让多个求解器互相挑毛病来调任务难度,比人工标靠谱,Terminal-Bench 上能涨二十多个点。原文稍后读已读值得跟进有用关注 CalibForge
09:27官方一手arXiv: OpenAI@Zehao Wang, Yisen Xu, Chenglin Li, Chao Peng, Bram Adams, Ahmed E. Hassan, Tse-Hsun, Chen精选论文提出 Ledger,一个确定性运行时层,将编码智能体的交互历史蒸馏为显式执行状态。它在模型行动前通过 inform 路径注入状态视图,在命令执行前通过 govern 路径复用有效结果并标记冗余操作。在 SWE-bench Verified 的 500 个实例上,Ledger 将 GPT-5 mini 的 Pass@1 从 56.2% 提升至 64.2%,将 MiniMax M2.5 从 75.8% 提升至 81.0%。成本分别降低 28.9% 和 31.8%;附加到 OpenAI Codex 后 Pass@1 提升 3.4 个百分点,成本降低 24.4%。消融实验显示 govern 贡献主要正确率提升,inform 贡献主要效率提升,两者结合效果最佳。论文LedgerSWE-benchGPT-5 mini10 个信源在谈事件专题推荐理由:arXiv 新论文做了个 Ledger 层,给编码智能体记账执行状态。GPT-5 mini 在 SWE-bench 从 56.2% 提到 64.2%,成本降 28.9%。原文稍后读已读值得跟进有用关注 Ledger
09:54官方一手pandaily@contact@pandaily.com (Pandaily)清华团队开源VeriLoop Coder-E1,基于Qwen3.6-27B模型。模型在SWE-bench Verified获得85.20分,SWE-bench Pro为62.38分,Terminal-Bench 2.0达76.40分,DeepSWE为33.63分。该模型采用窄领域PEFT和Self-Harness技术,实现仓库级代码修复的可验证递归自改进。AI模型VeriLoop Coder-E1Qwen3.6-27B开源模型推荐理由:清华开源了个能自己改代码的模型VeriLoop Coder-E1,SWE-bench拿85.2分,比很多大模型都强,想搞代码修复的可以试试。原文稍后读已读值得跟进有用关注 VeriLoop Coder-E1
12:57官方账号arXiv cs.AI@Manyi Wang, Junjielong Xu, Pinjia HePAIChecker是一个多智能体系统,用于检测SWE-bench类基准中PR与Issue配对不对齐的问题。研究者在SWE-bench Verified实例中发现13.6%存在不对齐,涵盖五种模式和十一个细粒度场景。PAIChecker采用三阶段设计,结合特定模式识别、跨智能体标签合成和代码级验证。在SWE-Gym和SWE-bench Multilingual上,该系统分别达到92.12%和91.67%的二元准确率,优于四种LLM后端。论文PAICheckerSWE-bench多智能体推荐理由:做代码基准测试的朋友可以看看,PAIChecker能自动揪出PR和Issue配错的情况,SWE-bench上准确率超九成。原文稍后读已读值得跟进有用关注 PAIChecker
11:27官方一手arXiv: DeepSeek@Tianyue Jiang, Yanlin Wang, Xin He, Daya Guo, Jiachi Chen, Ming Wen, Ensheng Shi, Xilin Liu, Yuchi Ma, Guanbin LiPhoenixRepair是一个多智能体框架,通过多位置采样和迭代反思扩大修复策略搜索空间。在SWE-bench-Verified上,相比SWE-agent在DeepSeek-V3.1下实现7.8%的相对提升。在MiniMax-M2.5下达到76.0% Pass@1的最高解决率。该框架的故障定位准确率也优于现有方法。论文PhoenixRepairSWE-bench智能体推荐理由:新论文的PhoenixRepair能更系统地探索代码修复位置,在SWE-bench上比SWE-agent提升了7.8%,做软件工程的值得一看。原文稍后读已读值得跟进有用关注 PhoenixRepair
09:11官方一手arXiv: OpenAI@Hong Yang, Qi Yu, Travis Desell该论文通过三臂消融实验(基线、仅bash、仅代码)在合成计算任务和SWE-bench Mini上,使用Claude Code和OpenAI Codex CLI两个代理,比较了限制为单一execute_code MCP工具的效果。在四个(任务制度, 代理设计)组合中,有三个组合(Artifact/Claude、SWE-bench/Codex、Artifact/Codex)显示限制工具显著更便宜或统计持平,且通过率无显著差异。唯一的例外是SWE-bench/Claude组合,仅代码方向性成本高14.4%但不显著,该差距源于失败轨迹的代价而非成功编辑的税收。结论是工具表面的最廉价选择由任务制度和代理设计共同决定,成本信号主要来自缓存调整成本而非通过率。论文Claude CodeOpenAI Codex CLIMCP10 个信源在谈事件专题推荐理由:这篇论文用Claude Code和OpenAI Codex CLI做对比实验发现,多数情况下只让AI用代码执行工具反而更便宜,还不影响成功率。只有Claude在SWE-bench上略贵一点点。想省API成本可以看看。原文稍后读已读值得跟进有用关注 Claude Code
22:15官方账号LMSYS Org (SGLang)@lmsysorg精选Netpreme发布博客,介绍将X-Mem MPU插入SGLang HiCache的分层KV缓存方案。在SWE-bench的Claude Code多轮编码中,前缀缓存命中率平均达98%。用X-Mem替换主机DRAM作为卸载层级后,TTFT降低6.7倍,每用户TPS提升33-50%,系统吞吐量提升30%。该方案通过HiCache的分层接口实现即插即用。AI模型NetpremeX-MemSGLang推荐理由:Netpreme的X-Mem内存插进SGLang的HiCache,多轮对话缓存带宽不再是瓶颈,TTFT降6.7倍,吞吐量涨30%,实测SWE-bench效果显著。原文稍后读已读值得跟进有用关注 Netpreme
10:16shao__meng@shao__meng精选71°Claude开发者团队分享两种多智能体模式:Advisor模式中,Sonnet 5作为执行者,仅在需要时调用Fable 5获取指导;Orchestrator模式中,Fable 5负责规划,将任务分派给多个Sonnet 5 worker并行执行。在SWE-bench Pro(482题)上,Sonnet 5单独得分为75.5%,成本0.75美元;Sonnet 5+Fable Advisor得分为84%,成本1.40美元;Fable 5单独得分为91.5%,成本2.25美元。组合方案达到Fable 5约92%的性能,成本仅为63%。在BrowseComp完整集上,全Sonnet 5得分为77.8%,成本16.01美元;Fable 5 Orchestrator+Sonnet workers得分为86.8%,成本18.53美元;全Fable 5得分为90.8%,成本40.56美元,编排方案达到约96%性能,成本仅46%。技巧Fable 5Sonnet 5Claude10 个信源在谈事件专题推荐理由:官方团队分享了两种省钱的混搭模式:用便宜的Sonnet 5跑大部分任务,偶尔让贵的Fable 5把把关,性能损失不大但预算砍半。原文稍后读已读值得跟进有用关注 Fable 5
07:03GitHub@github精选GitHub 在 SWE-bench Verified、SWE-bench Pro、SkillsBench、TerminalBench、Win-Hill 五个基准上对 Copilot agentic harness 进行了对比测试。固定模型和任务后,任务解决率与模型原生 harness 持平。在大多数配置下 token 消耗更少,最高可省 30%。Copilot 支持超过 20 个模型,用户可针对任务自由切换效率或质量。AI产品GitHubCopilotSWE-bench推荐理由:GitHub 实测了 Copilot 智能体框架,五个基准上不输原生,还省 token,支持 20 多种模型,值得试试。原文稍后读已读值得跟进有用关注 GitHub
03:57Stanford AI Lab@StanfordAILab精选斯坦福AI实验室提出DeLM(Decentralized Language Models),这是一种无需中央协调器的多Agent协作框架。在SWE-bench Verified基准上,使用Gemini-3 Flash的DeLM实现了约10%的性能提升,同时推理成本降低超过一半。该方法在编程和多文档问答等Agent任务中表现出更高的准确性和经济性。AI模型DeLMGemini-3 FlashSWE-bench推荐理由:斯坦福搞了个新方法DeLM,不用中央协调器调度Agent,编程和多文档问答更准更便宜,SWE-bench提升10%成本减半,值得试试。原文稍后读已读值得跟进有用关注 DeLM
13:20Cognition@cognition_labsCognition 宣布 AI Productivity Guarantee,承诺如果 Devin 在 30 天内未能提升工程效率,客户可获最高 1000 万美元退款。该保证基于 Devin 在 SWE-bench 上的表现和内部基准测试,覆盖代码生成、调试和部署等任务。Ryan Bai 详细解释了计算方法和验证流程,旨在降低企业采用风险。行业DevinCognitionAI生产力推荐理由:Devin 敢赌 1000 万保效率原文稍后读已读值得跟进有用关注 Devin
11:56官方账号arXiv cs.LG@Mengyu Zheng, Kai Han, Boxun Li, Haiyang Xu, Yuchuan Tian, Wei He, Hang Zhou, Jianyuan Guo, Hailin Hu, Lin Ma, Chao Xu, Guohao Dai, Lixue Xia, Yunchao Wei, Yunhe Wang, Yu Wang精选通用智能体(如OpenClaw)在编程任务上的表现难以用现有SWE-bench准确衡量,因为其不满足Docker工作区、补丁和预测合约要求。为此,研究者推出了Claw-SWE-Bench,一个多语言基准测试和适配器协议,能在固定提示、预算、工作区等公平条件下比较不同智能体框架。该基准包含350个GitHub问题实例,覆盖8种语言和43个仓库,并提供了80实例的轻量版Lite用于快速验证。实验显示,OpenClaw在直接适配器下仅得19.1% Pass@1,而完整适配器可达73.4%,表明适配器设计对编程任务至关重要。该基准将框架和成本作为评估核心维度,数据已开源。论文基准测试编程智能体OpenClaw1 个信源在谈事件专题推荐理由:做智能体编程评估的团队终于有了公平比较的基准——Claw-SWE-Bench解决了不同框架无法直接对比的痛点,建议做Agent评估的开发者直接用它来测试自己的适配器设计。原文稍后读已读值得跟进有用关注 基准测试
11:45官方账号arXiv cs.AI@Dun Li, Jiatao Li, Hongzhi Li精选这篇论文提出了 MetaAI 递归自设计的操作化证据框架,包含四个标准:可检查的目标系统、元级修改器、反馈导向选择和递归延续。作者将 DGM、STOP、Goedel Agent 和 ShinkaEvolve 等公开系统映射到该框架上,其中 DGM 提供了最直接的证据:经过 80 次迭代,SWE-bench Verified 从 20% 提升到 50%,Polyglot 从 14.2% 提升到 30.7%。消融实验表明开放探索和自我改进都有贡献。论文还提供了 MetaAI-Mini,一个基于 HumanEval 的可复现协议和代码库,但目前尚未包含完整模型运行结果。这项工作为 AI 自我改进提供了系统化的评估方法。论文递归自设计MetaAIDGM推荐理由:做 AI 自我改进研究的团队终于有了可对照的评估框架——DGM 的 80 轮迭代提升数据值得参考,建议用 MetaAI-Mini 协议复现验证。原文稍后读已读值得跟进有用关注 递归自设计
09:31shao__meng@shao__meng精选76°一篇大规模实证研究评估了仓库级上下文文件(如 AGENTS.md、CLAUDE.md)对编码 Agent 任务完成率的影响。实验覆盖 SWE-bench Lite 和新建 AGENTBENCH 两个基准,测试了 Claude Code、Codex、Qwen Code 等四种 Agent。结果显示,LLM 自动生成的 context file 在多数设置下导致成功率下降(平均 -0.5% 至 -2%),开发者手写的仅提升 +4%,但步数和成本增加 20% 以上。轨迹分析表明 Agent 会过度执行 context file 中的建议性流程,增加复杂度却未提升成功率。当仓库文档齐全时,context file 与现有文档高度冗余,反而可能有害。技巧Coding AgentAGENTS.md上下文文件推荐理由:这篇论文戳破了 AGENTS.md 的神话——自动生成不仅没用还更贵,手写提升也有限。做 Coding Agent 工具或维护大型仓库的团队,看完会重新评估是否值得投入 context file。原文稍后读已读值得跟进有用关注 Coding Agent
09:25官方账号arXiv cs.AI@Chuan Xiao, Zhengbo Jiao, Shaobo Wang, Wei Wang, Bing Zhao, Hu Wei, Linfeng Zhang, Lin Qu72°Socratic-SWE 是一种新型闭环自我进化框架,它利用 LLM 驱动的软件工程智能体的历史解决追踪来生成训练信号。与传统的固定突变或漏洞注入方法不同,该框架将追踪提炼为结构化技能,总结重复失败和有效修复模式,并指导生成针对性的修复任务。通过执行验证和求解器梯度对齐奖励筛选任务,Socratic-SWE 在 SWE-bench Verified 等基准测试上经过三次迭代达到 50.40% 的准确率,持续超越同等计算预算下的自我进化基线。这表明解决追踪可作为可扩展的自我进化基础,为提升编程智能体能力提供了新路径。论文智能体编程助手自我进化推荐理由:Socratic-SWE 解决了智能体训练数据依赖人工标注的瓶颈,做 AI 编程或智能体开发的团队可以直接借鉴其闭环进化思路,提升模型在真实仓库中的修复能力。原文稍后读已读值得跟进有用关注 智能体
22:17rohanpaul_ai@rohanpaul_ai精选72°一篇新论文指出,AI智能体的真实行为更多来自其外围的“控制层”(harness),而非模型本身或提示词。该控制层负责规划、工具调用、记忆、重试、验证和停止等逻辑,而许多智能体将这一层隐藏在代码中,导致问题难以调试。论文提出“自然语言智能体控制层”概念,用结构化自然语言表达这些逻辑,使其可检查、可移植、可测试。在SWE-bench上的实验表明,增加控制层结构会显著改变智能体行为,但并非总是带来性能提升。论文智能体控制层自然语言推荐理由:这篇论文戳中了AI智能体工程化的核心痛点——控制层设计比模型选择更关键,做智能体框架或复杂任务自动化的开发者值得一读。原文稍后读已读值得跟进有用关注 智能体
21:35官方一手Anthropic: Engineering(资讯)75°Anthropic 宣布其 Claude 3.5 Sonnet 模型在 SWE-bench Verified 基准测试中取得了 49.7% 的通过率,较此前最佳成绩提升了约 10 个百分点。该测试评估 AI 模型解决真实 GitHub 问题的能力,包括代码修复、功能实现等。Claude 3.5 Sonnet 在多个类别中表现优异,尤其在需要多步推理和上下文理解的复杂任务上。这一进展表明 AI 在软件工程自动化领域正快速接近人类水平。AI模型Claude 3.5 SonnetSWE-bench代码修复10 个信源在谈事件专题推荐理由:Claude 3.5 Sonnet 在 SWE-bench 上的突破意味着 AI 编程助手离真正解决复杂工程问题更近了一步,做软件开发的团队可以关注这一能力提升对日常代码修复和功能开发的潜在影响。原文稍后读已读值得跟进有用关注 Claude 3.5 Sonnet