#强化学习
想找能处理噪声数据、还能告诉你不确定性有多大的回归方法?ERRLESS用强化学习从后验里采样表达式,Feynman基准上表现不错,表达式还短。
Aftab架构在Atari-57上拿到IQM 6.479,比标准PQN基线强不少,代码和训练配置都开源了,搞RL的可以看看。
这篇论文提出 RRC,能把生成式奖励模型的排序结果转成强化学习能用的信号,在对话和推理任务上比现有方法更稳定地提升训练效果。
RL 训练嫌生成太慢?SpecRoll 用投机解码给 rollout 提速,不改采样分布,五个模型跑数学推理端到端快 1.2 倍以上,代码也开源了。
这篇论文提出了一种不用人工任务标注的训练方法,让LLM智能体自己从环境里找目标学,在ALFWorld和ScienceWorld上有效,还能给后续强化学习打底子。
DiagLoop只用合成数据就把8B诊断模型练到超过专有模型,工业系统+11.6分,疾病分类+5.5分,可以看看它的反事实数据飞轮。
DeepSeek-R1-Distill-Qwen-1.5B上,LSPO用LoRA支架捡回GRPO在零奖励提示上的梯度,比DAPO平均高3.8个点。
马斯克预告了Grok 4.6和4.7,参数飙到1.5万亿和2.1万亿,比之前4.5的'Opus级别'更猛,8月7日见。
如果你做强化学习,特别关注世界模型,这篇论文提出Reinformed Dreamer,用潜在引导训练不对称表示,比Informed Dreamer更稳定地超越Dreamer。
一篇教你用强化学习优化代码执行速度的论文,针对测量噪声和奖励稀疏问题设计了DMC-Optim基准和三阶段方法,让Qwen 2.5 7B的pass@1从18%提到31%,CWM 32B提到50%。
想用强化学习训开源模型?看看这个Prime Intellect实操教程,Nemotron Labs手把手带你跑通RL训练。