09:34官方账号arXiv cs.AI@Vishvesh Bhat精选73°PLVR是一种后训练方法,通过符号反向传播从输入输出示例中学习程序。该方法在LiveCodeBench v6和Tau2Bench基准测试中,30B基础模型比强化学习平均高出27.8分,比前沿大模型高出13.6分。PLVR使用单一原语库服务两个基准测试,新任务边际成本仅需100个程序搜索示例,无需额外微调数据。论文PLVR符号反向传播后训练推荐理由:PLVR让LLM推理过程可检查,30B模型性能超越强化学习和前沿大模型,还开源了符号反向传播库。原文稍后读已读值得跟进有用关注 PLVR