论文72°11:01DistIL:用分布化DAgger实现丰富反馈的强化学习DistIL解决了RLVR只利用最终答案信号的局限,让模型能从执行过程和专家反馈中学习,做推理模型和编程助手的团队值得关注这一新范式。#强化学习#DAgger#丰富反馈#推理模型aarXiv cs.AI@Rishabh Agrawal 等 3 人原文稍后读已读值得跟进有用关注 强化学习