vLLM 被 NVIDIA 新框架 Molt 选为 rollout 主力,支持 1T 级 MoE 规模,想搞强化学习可以试试这套组合。
#强化学习
Skyfall AI搞了个叫Morpheus的模拟环境,永不重置,专门测LLM能不能持续学习,结果发现它们根本不行。
Prime Intellect 搞了个 verifiers v1,专门给智能体强化学习和评估用的环境栈,能跑 coding、computer use 这些复杂任务,公司也刚拿了独角兽轮、ARR 破亿。
想了解 Prime Intellect 的异步 RL 框架和模块化验证系统吗?看看他们如何让长程智能体训练更高效。
AI大佬组团开怼现有深度学习:Sutton和Marcus联手发论文说光调参没用,得从头改架构,还搞了个新公司Oak Lab。想了解AI前沿争议的可以看看。
Prime Intellect 出了 Verifiers v1,把RL训练环境拆成任务集、框架和运行时三块,能自由组合,还自带拦截服务器收集数据,做智能体RL的可以试试。
PrimeIntellect发了Verifiers v1,用vLLM做强化学习rollout,token精度更高,训练更稳定。搞开源RL的可以看看。
Cognition分享了RL训练的新玩法:跨三大洲四数据中心混用自有GPU和FireworksAI,靠压缩权重差异同步,挺有意思。
Mistral 出了机器人模型 Robostral Navigate,8B 参数用单摄像头就能导航,R2R-CE 上 76.6%,轻巧实用。
想研究格斗游戏AI?这个新基准FootsiesGym基于极简游戏Footsies,自带高效模拟器,适合强化学习训练和对比。
Meta 的 Muse Image 在强化学习下自己学会了边画边改,能局部修也能重画,效果比直接生成更好,值得看看
一篇论文提出用强化学习+上下文压缩训练长程智能体,在SWE-bench等基准上显著提升开源模型表现,适合关注Agent训练和RL方法的人。
AWS手把手教你用SageMaker HyperPod+Nova Forge搭RL训练管道,上传数据到S3就自动开练,还用Wordle做了例子。
Thom Wolf做了个好玩项目:把一群AI代理协作写维基的过程变成像素风小镇,看它们进咖啡馆、上法院,超有趣。想了解RL训练LLM的协作方式?点进去看。
这篇论文教你用强化学习把难题拆成小模块再拼起来,Qwen和Code World Model上测试比传统RL省50倍算力,还能解原本解不出的题。
LiteResearcher是专门为深度研究智能体打造的RL训练框架,能更高效地训练复杂推理能力,适合关注智能体研究和强化学习的朋友。
前DeepMind三人组做的扑克AI,现在直接拿来给量化基金赚钱,公司都估值5亿美元了,跟那些纯吹概念的AI公司不一样,真有技术落地。