模型09:58蒸馏强化学习Distilled RL改进LLM后训练这个新方法把强化学习和知识蒸馏结合在一起,解决了RL和OPD各自的短板,跨家族蒸馏效果尤其好。#Distilled RL#LLM#后训练#知识蒸馏aarXiv cs.LG@Chen Wang 等 7 人原文稍后读已读值得跟进有用关注 Distilled RL