02:54elvis@omarsar0精选LLaDA2.2-flash在智能体基准τ²-Bench上取得592.80分,高于Ling-2.6-flash的334.90分。其快速模式更是达到705.30分。该结果展示了LLaDA2.2-flash在agentic任务上的优势。AI模型LLaDA2.2-flashLing-2.6-flashτ²-Bench推荐理由:LLaDA2.2-flash在智能体基准上把Ling-2.6-flash甩开一截,快速模式甚至冲到705分,做Agent研究的可以看看。原文稍后读已读值得跟进有用关注 LLaDA2.2-flash
09:57官方账号arXiv cs.AI@Yifan Wu, Lizhu Zhang, Yuhang Zhou, Mingyi Wang, Bo Peng, Serena Li, Xiangjun Fan, Zhuokai Zhao研究提出行为状态衰减概念,指长时任务中决策相关信息被淹没在轨迹中。一个独立的记忆智能体与行动智能体并行运行,更新结构化的记忆库并选择性注入提醒。在Terminal-Bench 2.0和τ²-Bench上,该方法将pass@1分别提升8.3和6.8个百分点。消融实验表明选择性干预优于被动暴露或持续注入。作为开放权重记忆策略的初步工作,在SETA上使用SFT和GRPO训练Qwen3.5-27B,提升验证奖励并部分迁移到Terminal-Bench。论文Proactive Memory AgentTerminal-Benchτ²-Bench推荐理由:长时任务里AI老忘事?这篇提出主动记忆智能体,随跑随记关键信息,在Terminal-Bench上提升8.3pp,比被动记忆好用多了。原文稍后读已读值得跟进有用关注 Proactive Memory Agent