论文12:31β-OPSD:用策略优化推导,用自蒸馏训练这篇论文把OPSD的隐式β变成可控参数,用蒸馏近似强化学习,数学推理上比原版更稳更强。#β-OPSD#自蒸馏#策略优化#推理模型aarXiv cs.LG@Jiawei Xu 等 5 人原文稍后读已读值得跟进有用关注 β-OPSD