#强化学习
Amazon AGI 这篇 AutoGym 论文挺有意思:一句话就能自动生成训练环境和验证器,做智能体强化学习的人可以省掉大量手工搭环境的活。
训练智能体 RL 的人可以看看:PEARL 动态调 prefill-decode 配置还能借闲置 GPU,吞吐比 RLBoost+ 最高多 36.3%。
把 CLIP 接进 PPO-Lagrangian 做安全强化学习,MetaDrive Hard 上事故率降了 12 个点,但作者自己发现信号并不能预判碰撞,分析很实在。
一个 7B 模型在 CUDA 上干过 Claude-4.5-Sonnet,靠的是两个小模型互相出题互相训练,生成 GPU kernel 的可以看看这套思路。
一篇训练方法论文:让统一模型自己看图、自己改图,用整条轨迹的 RL 训练,GenEval 比 SFT 高了 12 分,推理时还不用 verifier。
伯克利这边搞了个 X-Reset,把人类手部演示只用来当 RL 重置点,不用模仿,20 个物体三种机器人本体都能训出通用抓取策略,还能 sim-to-real 直接迁移。
这篇讲了个挺新的思路:不微调模型,而是让一个 proposer 用强化学习学会改智能体的 harness,测试时边跑边改。做 Agent 框架的可以看看。
ETH Zurich 把现成机械手改成了会走路的小机器人,能在草地碎石上爬、摔了能自己爬起来,还会敲键盘和推箱子,论文挂在 arXiv 上可以看看细节。
Salesforce 这篇论文很有意思:训练多轮工具调用时只练关键那一步,在 BFCL v4 上能多拿 14 个点,做法讲得很清楚。
Chelsea Finn 团队写了篇博客,讨论机器人怎么走 LLM 后训练的老路,还给出 EXPO-FT 方法,抓鸡蛋这类任务做到了 30 次全成功,只花 19 分钟真机交互。
NVIDIA 把社区写的 3.4k 个 Agent Skills 直接变成 RL 训练环境,300 步就把 Qwen 27B 在 Terminal-Bench 上拉高近 5 个点,流水线和负结果都写得很细,做 agent 训练的值得看看仓库。