7月22日
12:09
12:09官方账号arXiv cs.LG@Hanqing Zhu, Wenyan Cong, Zhizhou Sha, Sagnik Mukherjee, Xinyuan Song, David González-Martínez, Xiaoxia Wu, Yuandong Tian, Shiwei Liu, David Z. Pan, Zhangyang "Atlas" Wang
ISO是一种专门为可验证奖励强化学习(RLVR)设计的优化框架。它通过保持基模型的权重谱不变,仅优化输入输出奇异帧来实现模型适配。离线版本ISO-Merger无需数据或梯度就能合并多个专家模型,在无数据合并方法中性能最强。在线版本ISO-Optimizer在Qwen3-8B-Base上,仅用100步就达到AdamW需270步的准确率(0.495),210步后进一步提升至0.509。实验覆盖1.5B到8B参数的推理与代码任务。
推荐理由:如果厌倦了RLVR微调慢慢跑,试试ISO:只用1/3的训练步数就能达到同等效果,Qwen3-8B上实测有效,代码开源。