11:23官方一手arXiv: DeepSeek@Jiahao Zhang, Yifan Zhang, Yu HuangPMCoder是一种用于软件问题修复的LLM智能体,核心是将层次化阶段规划器与情景记忆双向耦合。在SWE-bench Verified基准上,它比匹配基线的设置平均多解决25个案例(+5.0个百分点)。在Verified-500上,Claude Haiku 4.5、DeepSeek-V4-Flash和OpenHands移植版均至少多解决14个案例(+2.8个百分点)。消融实验显示,规划与记忆联合使用优于单独使用任一组件,并显著减少重复失败动作和上下文耗尽。论文PMCoderSWE-bench VerifiedClaude Haiku 4.58 个信源在谈事件专题推荐理由:PMCoder把规划和记忆绑在一起,SWE-bench Verified上多解25个issue,换Claude或DeepSeek也有效,思路挺巧。原文稍后读已读值得跟进有用关注 PMCoder
11:31官方账号arXiv cs.AI@Yuqiao Tan, Jinxiang Meng, Fangyu Lei, Minzheng Wang, Shizhu He, Jun Zhao, Kang LiuSWE-Touch是一个新基准,通过注入与任务冲突的代码改动来测试编码代理在共享工作区中的适应能力。在SWE-bench Verified上,Counter-Edit使九个编码模型的平均解决率下降7.7个百分点。在SWE-Bench Pro和DeepSWE等更长周期任务上,退化依然存在。轨迹分析显示,代理可能保留冲突代码,或在没有重新检查仓库和运行定向测试的情况下直接替换。论文SWE-TouchSWE-bench VerifiedCounter-Edits推荐理由:编码代理平时跑分很强,但用户中途改代码就露馅。SWE-Touch实测9个模型,成功率平均掉7.7个百分点,原因挺有意思。原文稍后读已读值得跟进有用关注 SWE-Touch
07:53elvis@omarsar0精选76°NVIDIA提出NOOA框架,将智能体构建为Python对象,用单一抽象替代提示模板、工具模式、回调代码和工作流图四种组件。智能体的方法作为模型可调用的动作,字段持有状态,文档字符串作为提示,类型注解作为契约。方法体为“...”的会在运行时由验证过的LLM循环补全,有正常体则保持确定性Python,从而在源代码中划分概率与确定行为的界限。NVIDIA在SWE-bench Verified、Terminal-Bench 2.0和ARC-AGI-3三项基准上进行了评估。相关论文已发布在arXiv。论文NVIDIANOOAPython1 个信源在谈事件专题推荐理由:NVIDIA把智能体变成Python对象,方法当动作、字段管状态,测试和重构跟普通代码一样简单,效率翻倍。原文稍后读已读值得跟进有用关注 NVIDIA
17:09Stanford AI Lab@StanfordAILab71°斯坦福AI实验室提出TRACE自我改进方法,智能体通过识别自身失败背后的缺失能力并进行针对性训练来提升。TRACE训练的Qwen3.6-27B在SWE-bench Verified上达到73.2%,超过Codex 5.2和GLM 5等更大模型,同时以少于1/4的训练rollout击败GRPO和GEPA。该工作已在ICML AIWILD获得Spotlight论文。AI模型TRACEQwen3.6-27BSWE-bench Verified推荐理由:斯坦福AI Lab搞了个新方法TRACE,让AI自己找短板补课。只用四分之一训练量就超过了GRPO和GEPA,还赢了大模型Codex 5.2和GLM 5。原文稍后读已读值得跟进有用关注 TRACE
12:51官方账号arXiv cs.LG@Yujiang Li, Zhenyu Hou, Yi Jing, Jie Tang, Yuxiao DongCompactionRL是一种新的强化学习策略,用于训练长程agentic LLM,通过上下文压缩解决有限上下文窗口问题。该方法联合优化任务执行和摘要生成,采用token级损失归一化和跨轨迹广义优势估计,让LLM agent从压缩的长轨迹中学习。基于GLM-4.5-Air模型(106B-A30B),CompactionRL在SWE-bench Verified上达到66.8%的Pass@1,提升7.0点;在Terminal-Bench 2.0上达到24.5%,提升3.1点。基于GLM-4.7-Flash(30B-A3B),Pass@1分别提升5.5和6.8点。该技术已被部署于训练GLM-5.2模型(750B-A40B)的RL流水线。论文CompactionRLGLM-4.5-AirGLM-4.7-Flash推荐理由:一篇论文提出用强化学习+上下文压缩训练长程智能体,在SWE-bench等基准上显著提升开源模型表现,适合关注Agent训练和RL方法的人。原文稍后读已读值得跟进有用关注 CompactionRL
11:07官方账号arXiv cs.LG@Asa Shepard, Jeannie Albrecht论文提出探针-改进调优法,通过合成bug修复探针迭代诊断和修补仓库指导文件,无需代理循环或工具调用。在SWE-bench Verified上,使用Qwen3.5-35B-A3B模型200步,平均解决率33.0%,高于静态知识库的28.3%和无指导基线的25.5%(p<0.001)。改进来自覆盖度而非精确度:优化指导使可评估补丁增加14.5个百分点,但补丁精确度稳定在约59%(p=0.119)。跨模型实验显示,当模型无法生成足够诊断输出时调优效果下降,但补丁精确度仍保持恒定。论文探针-改进调优SWE-bench VerifiedQwen3.5-35B-A3B推荐理由:这篇论文告诉你:给编码智能体写AGENTS.md时,别一次性写好就完,得用探针-改进法迭代修。实测在SWE-bench上解决率涨了近5个点,主要是能让智能体多搞定14.5%的实例。原文稍后读已读值得跟进有用关注 探针-改进调优