精选理由
开放式任务也能用强化学习自我改进了,这篇论文把RLVR升级成RLSVR,不用人工奖励,AI自己验证自己。
这篇论文提出从RLVR到RLSVR的转换方法,用任务变换为开放式LLM生成自验证奖励,从而支持无需外部反馈的自我改进。RLVR原本依赖可验证答案,RLSVR将其扩展至开放式任务,让模型自己产生验证信号。论文已上线Hugging Face,由akhaliq转发推荐。
原文 · AK
From RLVR to RLSVR Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Impr...
From RLVR to RLSVR Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement paper: huggingface.co/papers/2607.23… 💬 0 🔄 0 ❤️ 5 👀 1173 📊 2 ⚡