7月13日
15:43
15:43官方一手marktechpost@Michal Sutter
精选
Prime Intellect 发布了 Verifiers v1(0.2.0版本预览),将强化学习环境拆分为三个可组合组件:taskset(定义任务)、harness(执行方式)和runtime(运行位置)。系统包含一个拦截服务器,可代理请求并记录训练轨迹。任何taskset均可与任意兼容的harness和runtime搭配,并立即支持 prime-rl 训练框架。
推荐理由:Prime Intellect 出了 Verifiers v1,把RL训练环境拆成任务集、框架和运行时三块,能自由组合,还自带拦截服务器收集数据,做智能体RL的可以试试。
7月2日
12:35
12:35官方账号arXiv cs.LG@Zijian Zhang, Rizhen Hu, Athanasios Glentis, Dawei Li, Chung-Yiu Yau, Hongzhou Lin, Mingyi Hong
本文基于Qwen3和Qwen2.5共7个模型,使用GRPO、GiGPO、Dr. GRPO三种RL算法,在数学推理、代码生成和智能体决策任务上实验。研究发现训练单层Transformer即可恢复全参数RL训练大部分甚至全部改进。作者引入“层贡献”指标量化单层训练相比全参数训练的收益比例。结果显示RL收益高度集中于少数中间层,输入输出层贡献显著较低。
推荐理由:这篇论文发现RL训练只需调优一层Transformer就能接近全参数效果,还揭秘中间层才是关键,刷新认知。
6月26日
08:55
08:55Fireworks AI@FireworksAI_HQ
精选
Fireworks 宣布对 NVIDIA Nemotron 3 的强化学习微调功能上线,首批支持 Nemotron 3 Super 的 LoRA 微调。训练采用 GRPO 算法,可在一处平台完成训练和部署。计费方式改为按 GPU 小时而非按 token,解决了长多轮对话成本不可控的问题。
事件专题

推荐理由:Fireworks 刚上线了 Nemotron 3 的 RL 微调,按 GPU 小时计费不怕长对话烧钱,用 GRPO 训练一条龙搞定。