论文09:47RODS: 奖励驱动的在线数据合成用于多轮工具使用智能体这篇论文用奖励方差自动发现困难样本并生成新数据,训练效率比静态数据高20倍,特别适合多轮工具智能体场景。#RODS#GRPO#工具使用智能体#强化学习aarXiv cs.AI@Ruishan Fang 等 4 人原文稍后读已读值得跟进有用关注 RODS