#强化学习
HuggingFace 开源了 5000 个数据科学 RL 任务,源自真实 Kaggle 笔记本,评分不用 LLM 判卷,还配了 SFT 轨迹和 Colab 脚本,想自己练小模型可以直接上手。
Hugging Face 开源了 5000 个可验证 RL 任务,专练小模型的代码和数据科学能力,环境和训练脚本全给你,想自己跑 RL 的可以看看。
用 Fireworks 和 HUD 这套流程,你不用自己搭 RL 训练基础设施,定义一次任务就能边训边评,自己微调模型的可以看看。
摩尔线程用 MTT S5000 跑具身 RL,训练曲线和主流 GPU 相关性 0.976,双臂装配成功率 92%,国产卡跑机器人训练又多了个实测数据点。
DeepSeek 发论文讲了训练智能体的沙箱系统 DSec,一天能跑 300 万个沙箱,并发 38 万,做 RL 训练的可以看看。
腾讯混元把经典批大小理论搬进了 LLM 强化学习,实测 PPO 吞吐提升 2.29 倍、GRPO 训练省 29% 时间,做 RL 训练的可以看看怎么调参省钱。
教小模型做数学题的新训练方法,把教师模型的逐token提示和答案对错验证揉进一个GRPO更新里,Qwen3-1.7B和4B都涨了不到1个点,做RL训练的可以看看细节。
给机器人策略做"删除指定动作"的遗忘方法,在 Unitree G1 和 H2 上验证过,涉及 GDPR 和安全问题的话很值得看看思路。
做强化学习的可以看看:RACER 用自适应扰动和 critic 一致性正则,解决了对抗训练里对手太狠把智能体带偏的问题,连续控制实验效果确实比老基线稳。
Fireworks 出了个 ARCv3 压缩器,能把 BF16 权重更新压小近一半,自己搭 trainer 跑 RL 的团队可以省不少跨区传输成本。
标注预算不够又想评估策略?这篇 arXiv 论文告诉你怎么分配人工标注最省钱,RMSE 能降一半以上。
一篇把 LLM 强化学习里 credit assignment 讲清楚的论文,PACT 训练后在数学推理上比 GRPO 高 8.8 个点,搞 RL 后训练的值得看看推导。
一篇教 RL 生成 SVG 的论文:把每条指令拆成 6 项评分细则当奖励,不需要标注数据,效果追平 DeepSeek-V3,做生成任务奖励设计的可以看看。
Thom Wolf 点名的一套开源 RL 环境要来了,附约 7k 训练数据和框架,还练出 Artificial Analysis 前六的模型,做 RL 的可以蹲一下。
小米把 MiMo-V2.6 权重全开源了,Pro 在 AA 指数拿 46 分压过 Kimi K3,价格只有海外模型的 1/20。