07:54elvis@omarsar0精选Meta和CMU联合提出ACM(Agentic Context Management)方法,用于长周期智能体任务。传统方法按token阈值压缩并丢弃上下文,ACM让智能体自主决策何时压缩,将丢弃内容存入外部记忆并可查询。基于高质量演示的后训练pipeline在BrowseComp-Plus基准上取得27%相对提升,性能接近比它大40倍的开源模型。代码、数据和checkpoint已开源。论文MetaCMUACM推荐理由:Meta和CMU的新研究:智能体自己管理上下文,不再傻傻丢东西。在BrowseComp-Plus上提升了27%,代码已开源,值得看看。原文稍后读已读值得跟进有用关注 Meta
11:20官方账号arXiv cs.LG@Leitian Tao, Baolin Peng, Wenlin Yao, Tao Ge, Hao Cheng, Mike Hang Wang, Jianfeng Gao, Sharon LiTRACE是一种密集信用分配方法,用于代理强化学习,通过冻结参考模型获取黄金答案的log概率,转化为log比值状态值,并利用时间差分变化推导每动作奖励。在长程复杂搜索中,该方法无需冷启动监督微调或中间训练,即可显著提升基础模型工具使用能力。在封闭网络BrowseComp-Plus基准上,TRACE将Qwen3-4B从7.2提升至35.6,将Qwen3-30B-A3B从8.4提升至42.6。学习曲线显示RL训练期间更快改进和收敛。论文TRACEQwen3BrowseComp-Plus推荐理由:想解决Agent长程任务奖励稀疏问题?看TRACE方法,无需额外批评器,用TD变化给每步打分,Qwen3在BrowseComp-Plus上从7分直接跳到35分。原文稍后读已读值得跟进有用关注 TRACE
11:38官方账号arXiv cs.LG@Zijun Xie, Binbin Zheng, Enlei Gong, Jihua Liu, Yuyang You, Lingfeng Liu, Jiayao Tang, Guanqun Zhao, Aoqi Hu, Zeyu ChenECHO通过源索引重建方法,将每个环境交互回合压缩为紧凑记忆记录,并从中选择构建策略上下文。该方法在BrowseComp-Plus基准上达到43.4%保留准确率,超越GRPO的28.9%和SUPO的36.1%,且使用更少回合和轨迹量。训练后的策略在多项问答、代码生成和深度信息检索任务中实现了零样本泛化提升。论文ECHOBrowseComp-Plus智能体推荐理由:这篇论文提出的ECHO框架,能让智能体在长回合任务中既保留细粒度证据,又能用强化学习追踪信用分配,效果比GRPO和SUPO都强。原文稍后读已读值得跟进有用关注 ECHO