论文00:17从RLVR到RLSVR:任务变换让LLM自我改进用上自验证奖励开放式任务也能用强化学习自我改进了,这篇论文把RLVR升级成RLSVR,不用人工奖励,AI自己验证自己。#RLVR#RLSVR#自我改进#强化学习AK@_akhaliq原文稍后读已读值得跟进有用关注 RLVR