论文精选83°11:08自训练验证器STV:解锁推理模型的训练与测试时自改进推理模型开发者长期受困于验证器失效导致自改进停滞,STV用参考答案不对称性巧妙破解,在困难数学和科学任务上效果显著,做自训练或测试时搜索的团队值得深入看。#推理模型#自训练验证#测试时改进#强化学习aarXiv cs.AI@Chen Henry Wu, Aditi Raghunathan原文稍后读已读值得跟进有用关注 推理模型