00:17AK@_akhaliq这篇论文提出从RLVR到RLSVR的转换方法,用任务变换为开放式LLM生成自验证奖励,从而支持无需外部反馈的自我改进。RLVR原本依赖可验证答案,RLSVR将其扩展至开放式任务,让模型自己产生验证信号。论文已上线Hugging Face,由akhaliq转发推荐。论文RLVRRLSVR自我改进推荐理由:开放式任务也能用强化学习自我改进了,这篇论文把RLVR升级成RLSVR,不用人工奖励,AI自己验证自己。原文稍后读已读值得跟进有用关注 RLVR