论文09:34RL后训练构建组合推理策略这篇论文用可控实验证明了RL后训练能从头组合出高级推理策略,不是只增强已有技能,对理解强化学习训练机制很有启发。#Transformer#RL#rejection fine-tuning#组合推理aarXiv cs.AI@Azwar Abdulsalam 等 3 人原文稍后读已读值得跟进有用关注 Transformer