论文精选09:54AdaPrefix-GRPO:自适应前缀控制提升困难推理问题训练效果这篇论文解决了GRPO训练时难问题学不到东西的痛点,用自适应前缀让模型在数学推理上准确率翻倍,而且模型越小效果越明显,值得做强化学习的人看看。#AdaPrefix-GRPO#GRPO#Qwen3#AIMEaarXiv cs.LG@Vladislav Beliaev原文稍后读已读值得跟进有用关注 AdaPrefix-GRPO