17:50Amjad Masad@amasad开发者Amjad Masad发现,训练chess LLM从棋盘局面到走子对时遭遇收益递减。意外中,一个“先思考再走子”分支虽然产生幻走,但混合约8%的推理轨迹到纯走子数据后,在相同预算下效果超过纯走子数据。模型内化了推理过程,但推理时不显式使用。新部署的象棋引擎估计约1200 Elo,目标是达到2000+,且保持小规模微调LLM、无引擎辅助的约束。技巧Amjad Masadchess LLM推理模型推荐理由:这个意外发现很有意思:混一点点推理数据,不改变推理过程,象棋AI就变强了。适合研究模型训练技巧的人。原文稍后读已读值得跟进有用关注 Amjad Masad