#强化学习
这个 PARTS 框架挺有意思,就是针对机器人执行长时程任务时,那些容易卡壳的关键步骤,用强化学习去专门训练,效果比单纯用预训练策略好很多,而且需要的人类操作也少。
朋友,有个挺有意思的论文,说训练了一个4B的模型,能让Postgres的查询计划速度提升81%,但实验环境太受限了,推广性存疑,值得看看。
这是篇关于如何提升强化学习目标可靠性的论文,作者提出了CARE-VI框架,通过CARS、SEVA和DARE三个组件来管理候选动作和修正量,在多个基准任务上取得了更好的结果。
朋友,这是篇挺有意思的论文,讲的是怎么用一种叫RetireOPD的新方法来训练AI智能体,效果比直接用强化学习好不少,在几个任务上都有明显提升。
小米搞了个叫MiMo-V2.6的模型,在研究多任务代理RL怎么扩展,计算量很大,每步20亿令牌,用了很多提示和滚动,还混合了多种环境,挺有意思的。
朋友推荐:Songyan Dynamics 新出的 HERON-CRA 模型,加了上下文记忆和强化学习引擎,能更好地控制机器人做袜子折叠,效果提升明显。
小米开源了他们新模型 MiMo-V2.6 的训练细节,能让你了解如何用 RL 构建开源 AI,和之前的方法比,他们把计算、环境和评估都做了更大规模的扩展。
这是篇研究论文,作者提出了一种叫CanvasAnneal的新框架,专门用来提升扩散语言模型做复杂推理的能力,比如数学题和用工具,效果比之前的方法好。
这个研究解决了自动驾驶中一个很实际的问题,就是让AI驾驶更符合人类舒适感。他们开发了一个方法,让AI在控制车辆时更平滑,不会突然加速或转向,比之前的方法更好。
Hugging Face 新出的 TRL 库版本,能直接训练百万级 token 的模型,比之前版本更强大,适合做长文本任务。