模型12:09ISO:面向RLVR的等谱优化框架,加速模型微调如果厌倦了RLVR微调慢慢跑,试试ISO:只用1/3的训练步数就能达到同等效果,Qwen3-8B上实测有效,代码开源。#ISO#RLVR#Qwen3#优化框架aarXiv cs.LG@Hanqing Zhu 等 11 人原文稍后读已读值得跟进有用关注 ISO