机器人长时程任务中针对关键子任务的强化学习框架 PARTS
这个 PARTS 框架挺有意思,就是针对机器人执行长时程任务时,那些容易卡壳的关键步骤,用强化学习去专门训练,效果比单纯用预训练策略好很多,而且需要的人类操作也少。
这个 PARTS 框架挺有意思,就是针对机器人执行长时程任务时,那些容易卡壳的关键步骤,用强化学习去专门训练,效果比单纯用预训练策略好很多,而且需要的人类操作也少。
Recuris模型在长时程任务中显著提升了GPT-5.6 Sol和Claude Opus 5的表现,是长时程智能体驱动的递归记忆架构的一个突破。
有人发了 LongHorizon-Harness,一个专测长时程智能体的框架,论文在 Hugging Face,想评估多步任务表现可以看。