论文Agent 与开发者10:24探索广度与推理精度:通过采样提升小模型性能新PPT方法让小模型通过并行采样达到前沿性能,比强化学习训练更高效。#Power Tempering#LLM#推理模型#采样方法aarXiv cs.LG@Panagiotis Theodoropoulos 等 7 人原文稍后读已读值得跟进有用关注 Power Tempering