12:06官方账号arXiv cs.LG@Zhaoxin Yu, Qi Shen, Hengli Li, Zhaowei Zhang, Song-Chun Zhu, Chi Zhang, Zilong ZhengGradCuit在Transformer层间插入可优化潜在状态,使奖励加权梯度直接分配给潜在变量。在五个指令微调基座、三个推理基准和两种答案格式上,GradCuit平均准确率64.5%,比思维链提示高6.6个百分点,比最强对比方法高2.4个百分点。在七个学习率设置下,GradCuit准确率标准差从1.53降至0.82,其随机游走变体仍与LatentSeek相当。层分析显示早中期Transformer层是最有效的优化空间。论文GradCuitarXiv推理模型推荐理由:想让LLM更会推理?GradCuit不用改参数,直接优化内部状态,准确率比CoT高6.6个点,而且还更稳定,值得试试。原文稍后读已读值得跟进有用关注 GradCuit