04:12elvis@omarsar0精选该帖子提出一个后训练技巧:训练长周期智能体(long-horizon agents)时无需使用长周期 rollout。可以在短任务(short tasks)上训练,这类任务奖励成本低且验证容易。然后利用框架(harness)将能力扩展8-32倍,显著降低训练成本。技巧post-traininglong-horizon agentsshort tasks推荐理由:这篇帖子讲了个后训练小诀窍:短任务训练就能让智能体扩展到8-32倍的长周期,省时省力,值得试试。原文稍后读已读值得跟进有用关注 post-training