论文精选12:38A* 搜索后训练让 1B 模型推理超越 DeepSeek-V3.2A* 搜索让小模型推理能力大幅跃升,做推理优化或小模型部署的团队值得关注,可以直接参考其训练方法。#推理模型#A* 搜索#后训练#强化学习aarXiv: DeepSeek@Andreas Opedal 等 6 人原文稍后读已读值得跟进有用关注 推理模型