研究发现:基础模型加一句前缀即可提升推理成绩
有人发现给基础模型加一句"Okay"开头,Olmo-3-7B 在 MATH-500 就从 42% 涨到 78%,原理分析也很有意思。
一个新研究展示,在问题前拼接 ".\n\n Okay" 能把 Olmo-3-7B 在 MATH-500 上的 pass@1 准确率从 42% 提到 78%," Alright ," 则把 Qwen3-14B 从 72% 提到 87%。作者分析这类开头语在训练数据中常与推理过程同时出现,基础模型据此激活相关能力。实验还发现 RL 训练让模型更倾向生成这类线索,固定该前缀后能复现 RL 相对基础模型的大部分性能增益。
Base Models Can Reason By Taking a Cue From Training Data
Prepending ".\n\n Okay" raises Olmo-3-7B’s MATH-500 pass@1 accuracy from 42% to 78%, while " Alright ," raises Qwen3-14B’s from 72% to 87%
RL makes these cues more likely, while fixing them recovers much of its performance gain over the base model.