论文精选76°12:09RELEX:仅需15%训练步数,通过秩-1轨迹外推提升LLM推理能力RLVR训练成本高昂,RELEX用极低成本实现同等推理提升,做LLM推理优化的团队可以直接用代码复现,值得一试。#强化学习#推理模型#低秩近似#参数外推aarXiv cs.LG@Zhepei Wei 等 6 人原文稍后读已读值得跟进有用关注 强化学习