10:44arXiv cs.LG@Johannes Zenn, Jonas Geiping该论文在多个解码方法(如温度采样、束搜索)和多个模型(如LLaMA-2、GPT-4)上分析序列概率与正确性的对齐关系。在固定数据集内,高序列概率通常预示正确,但改变超参数或解码方法提升序列概率并不稳定提高准确度。对于同一提示的多次回复,序列概率与正确性相关性很弱。研究为解码策略、自一致性等提供实践指导。论文LLMsequence probabilitycorrectnessdecoding自一致性推荐理由:论文搞清楚了啥时候模型觉得对就真的对。它告诉你别光看概率,同一问题重复问,概率高不一定准,做解码或自一致性时可参考。原文