研究:特定起始 token 提示可让 base 模型接近 RL 训练后的推理表现
不用 RL 训练,只在开头加个 "Okay" 就能让 Olmo-3-7B 数学成绩翻近一倍,这篇论文把原因挖得很透,做模型训练的值得看看。
不用 RL 训练,只在开头加个 "Okay" 就能让 Olmo-3-7B 数学成绩翻近一倍,这篇论文把原因挖得很透,做模型训练的值得看看。
这篇论文用 gsm_hard 上的 120 题实验算清了一笔账:流水线出错后,把原题重新喂给第一个下游阶段就能挽回 0.394,每题只多花 59.8 个 token,后面的阶段白搭。
想看看AI在规则变了之后能不能自己改代码?PACE-Bench 专门测这个,目前最强的 GPT-5.5 也只解决了 Statics 子集的三分之二,离满分还远得很。
这篇论文用Qwen3-14B和DPO实验证明,离线训练越保守,在线适应越容易翻车,还在GSM8K上给出了最优保守度公式。做RLHF的值得一读。
代码生成的不确定性评估长期被自然语言方法误导,这篇论文给出了三个正交维度,做代码LLM安全评估或部署的团队值得仔细看,能直接改进选择性预测和人工审查流程。