11:52官方账号arXiv cs.AI@Congfeng Cao, Pengyu Zhang, Jelke Bloem本文系统研究了思维模式融合(TMF)训练中思考与非思考模式的数据比例和训练调度对数学推理的影响。作者构建了包含多种数据比例和三种训练调度的基准测试,发现增加非思考监督比例会降低思考模式准确率,两者存在不对称交互。不同训练调度可调节这种权衡,最优调度取决于数据比例。研究还量化了两种模式监督间的负相关,为TMF训练设计提供实践指导。代码和数据已在Fusion Bench开源。论文TMF数学推理训练调度推荐理由:想搞懂思考模式和非思考模式怎么配比训练?这篇论文用数学题做了系统实验,告诉你数据比例和调度怎么影响推理准确率,还开源了基准。原文稍后读已读值得跟进有用关注 TMF