论文11:55多轮长程规划训练:从预训练到后训练的单/多教师在线策略蒸馏这篇用一个可控环境拆解了AI长程规划的训练机制,发现次优数据会拖累性能,多教师蒸馏能整合不同能力,值得做训练方法的人细读。#MOPD#GRPO#OPD#长程规划aarXiv cs.LG@Tianyi Men 等 4 人原文稍后读已读值得跟进有用关注 MOPD