事件专题 ·单一信源

自回归语言模型中局部与全局置信信号不一致的研究

研究自回归语言模型中两种置信度读数(局部置信度基于贪婪选择的答案标记概率,全局置信度基于重复采样下的众数答案频率)在MMLU和ARC Challenge基准上的相关性。结果显示两者相关性较弱且与正确率关联不同:全局置信度与正确率中度相关,而局部置信度关联性小。进一步发现ARC上置信度差距与采样不稳定性的关联(如答案熵高、采样答案区分度大、众数答案集中度低)比MMLU上更显著,这表明两种置信读数在评估模型可靠性时不可互换。

当前结论

这是篇研究论文,分析了自回归语言模型中两种置信度信号(局部和全局)的差异,对理解模型预测的稳定性很有帮助。

2 个信源44° AI 热度最后更新 2026/9/15 10:08:48

证据链

2 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。