13:24
13:24
官方账号arXiv cs.AI@ZhiYan Hou, Xinyu Tang, Hongyan An, Jianjin Zhang, Weizhen Wang, Yunyun Han, Gengsheng Li, Xiangzhao Hao, Haiyun Guo, Wenbin Hu, Jinqiao Wang, Yafeng Deng 论文提出DASH方法,用于改进带可验证奖励的强化学习(RLVR)中奖励稀疏的问题。标准OPSD对所有局部发散使用相同权重,忽略了生成过程中发散序列的时间结构。DASH根据局部蒸馏信号与序列均值的差距自适应调整token级监督权重,控制反向多步聚合。在三个数学推理基准和三种模型规模上,DASH均优于匹配的vanilla OPSD。该方法复用OPSD已有的师生分布,不额外增加前向传播成本。
推荐理由:这篇论文提出了DASH,能让推理模型在自蒸馏时按发散情况动态调整权重,三个数学基准上全面超过原版OPSD,还不用额外算力。
13:18
13:18
官方账号arXiv cs.AI@Zishan Xu, Zhiyuan Yao, Yuxin Chen, Yifu Guo, Zhengxi Lu, Yuquan Lu, Jinyang Huang, Yan Xu, Yasheng Wang, Weinan Zhang, Xingshan Zeng, Weiwen Liu EnvACE 是一种面向大语言模型智能体的强化学习方法,训练时不再依赖真实或合成的可执行环境交互,而是让策略交替执行动作和扮演环境产生响应。该方法在 BFCL-v4、tau^2-Bench、VitaBench 和 FinMCP-Bench 四个基准上表现优异,整体评估超过环境扩展类基线。受控实验表明,世界预演在不同模型规模下都能稳定提升策略学习效果。测试阶段,内化的世界模型还可在提交执行前进行私有预演,在中等预演预算下获得额外增益。代码已在 GitHub 上公开。
推荐理由:EnvACE 让模型自己脑补环境的反馈,省去搭建外部模拟器,四个基准上还赢了。想低成本练智能体的可以看看。
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。