11:33官方账号arXiv cs.LG@Michael Jungo, Aixiu An该研究探讨了基于可验证奖励的强化学习(RLVR)在神经机器翻译(NMT)后训练中的应用。实验发现,在推理阶段保留模型的推理痕迹能显著提升翻译质量,尤其在法律文档翻译中表现突出。但推理过程导致输出token数量增加约30%,需在计算成本与翻译质量间权衡。研究通过系统性地从训练或推理阶段移除推理轨迹,明确了推理痕迹对质量的贡献主要来自推理阶段而非训练阶段。论文RLVR神经机器翻译强化学习推荐理由:这篇论文用实验告诉你:机器翻译加推理步骤质量更好,但token成本涨三成,做生产部署前得算清楚这笔账。原文稍后读已读值得跟进有用关注 RLVR