CoreWeave RL Rollouts 实现训练中热加载权重,BrowseComp 提升 8.5 个点
做 RL 训练的朋友看下,CoreWeave 这个功能把换检查点的时间砍掉约 15 倍,Nemotron 实测 BrowseComp 涨了 8 个多点。
做 RL 训练的朋友看下,CoreWeave 这个功能把换检查点的时间砍掉约 15 倍,Nemotron 实测 BrowseComp 涨了 8 个多点。
CoreWeave 发布了 Forge,能分析智能体日志找失败原因,ARIA 还会给出改进计划,做 Agent 的朋友可以直接试试。
DeepSeek 把训 Agent 最难的环境基建摊开讲了:每秒造 5000 个沙盒怎么做到,容器、虚拟机、镜像加载的全套工程细节都在论文里。
Prime Intellect 出了 Verifiers v1,把RL训练环境拆成任务集、框架和运行时三块,能自由组合,还自带拦截服务器收集数据,做智能体RL的可以试试。
Fireworks 刚上线了 Nemotron 3 的 RL 微调,按 GPU 小时计费不怕长对话烧钱,用 GRPO 训练一条龙搞定。