Apple 提出 RISED:基于 rubric 的多环境智能体训练数据选择方法
Apple 的论文,讲怎么在多个交互环境里同时训练一个 LLM 智能体,用 rubric 评分挑数据,全对全错的样本也能靠自蒸馏利用起来。
Apple 的论文,讲怎么在多个交互环境里同时训练一个 LLM 智能体,用 rubric 评分挑数据,全对全错的样本也能靠自蒸馏利用起来。
arXiv 上这篇挺有意思:想知道 RL 训练后哪些题能解出来,用别的模型训过的 checkpoint 预测,比一堆先验指标都准。
做微调的朋友可以看看:LESSER 只用输出层梯度就能做数据选择,SFT 成本砍到近十分之一,效果不掉,还提供了 drop-in 接口。