#RLVR
共 34 条 · 7 天 5 条 · 30 天 8 条
信息流里打上「RLVR」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月8日
10月7日
François Chollet 提出疑问:能力边界是否主要取决于数学与代码
Keras 之父 Chollet 抛了个有意思的问题:RLVR 只能拉高数学和代码,其他领域能不能跟着涨还不确定,这直接决定接下来模型能走多远。
10月4日
Build A Reasoning Model 第 6 讲:用纯 PyTorch 从零实现 GRPO 训练推理模型
Raschka 又更新了,这讲直接用 PyTorch 手写 GRPO,把 Qwen3-0.6B 的数学成绩从 15% 拉到 47%,想搞懂推理模型怎么训的别错过。
Sebastian Raschka 发布第6期教程:从零实现 RLVR 与 GRPO 训练推理模型
Raschka 又出新教程了,这次手把手带你从零写 GRPO,把 DeepSeek-R1 那套推理训练方法完整实现一遍,还带 MATH-500 评测结果。
9月29日
9月22日
Thom Wolf 称开源高质量 RL 环境是当前推动开源前沿最有影响力之举
Thom Wolf 点名的一套开源 RL 环境要来了,附约 7k 训练数据和框架,还练出 Artificial Analysis 前六的模型,做 RL 的可以蹲一下。
9月11日
9月9日
9月7日
9月4日
9月3日
9月1日
8月19日
8月15日
8月7日
8月6日
8月4日
7月29日
7月22日
7月15日
7月2日
6月23日
6月18日
6月9日
PAEC:位置感知熵校准提升LLM推理RLVR效果
做LLM推理强化学习的团队终于有了更精细的熵控制方案——PAEC在数学推理任务上直接提升多数投票性能,做RLVR的开发者值得关注这个位置感知的新思路。
5月26日
Open-MM-RL 教程:构建多模态 RLVR 管线,含视觉语言提示与 GRPO 导出
多模态 RLVR 是当前强化学习与视觉语言结合的热点方向,这篇教程从数据集到奖励函数再到导出一步到位,做多模态推理或 RL 研究的团队可以直接照着搭,省去自己踩坑的时间。
5月21日
DelTA:用判别性Token信用分配提升RLVR推理能力
做RLHF或推理模型训练的团队,终于有了一个能精准分配token级信用的方法——DelTA解决了高频格式token淹没关键信号的问题,数学和代码任务上效果显著,值得在自家模型上试试。
5月20日
POW3R:让RLVR的评分标准更智能地指导训练
做RLHF或RLVR的团队终于有了更聪明的奖励设计——POW3R解决了静态评分标准浪费训练信号的问题,做多模态或文本模型对齐的开发者可以直接参考实验设置。
GoLongRL:面向长上下文的强化学习训练方案,开源数据集与TMN-Reweight方法
长上下文 RL 训练的数据构建和奖励设计一直是个难题,GoLongRL 提供了开源数据集和优化方法,做长上下文模型训练的团队可以直接复用,省去大量数据构造工作。