07:52elvis@omarsar076°Meta 新研究提出 EvoHarness-RL,让智能体离线学习 harness 策略并在运行时在线构建外部状态。该策略利用 Belief、Progress、Experience 三类状态,先通过监督微调学习动作空间,再使用成本感知 GRPO 优化。基于 Qwen3-8B 的智能体在 ALFWorld 基准上达到 96.9%。训练中出现 harness annealing 和 harness evolution 两种动态,前者将重复模式吸收进模型策略,后者压缩工作区为紧凑状态。研究认为长程智能体更取决于可训练协调策略,而非更大工具或记忆。论文EvoHarness-RLMetaQwen3-8B推荐理由:Meta 新论文让智能体学会管理外部记忆,Qwen3-8B 在 ALFWorld 到 96.9%,长任务不用堆工具。原文稍后读已读值得跟进有用关注 EvoHarness-RL