11:15官方账号arXiv cs.LG@Jianru Shen精选该研究评估了11个指令微调模型在ARC-Challenge和TruthfulQA上的25,168次预测,参数规模从0.5B到14B。理论证明严格单调校准可保持风险覆盖前沿和错误检测AUROC,而温度缩放无法校准置信度恒高于准确率的模型。Clopper-Pearson方法可将200题校准集转化为有限样本风险证书。实证显示8/22个模型-任务对逼近温度缩放不可行下限,Platt缩放将ECE降至0.02。20%风险预算下仅3个模型-任务对获得认证自主权,10%预算下为零,并修复了TruthfulQA多项选择的答案顺序伪影。论文ARC-ChallengeTruthfulQA不确定性校准推荐理由:这篇论文测了11个小模型,发现温度缩放有校准不了的边界,用200道题就能算风险上限,20%风险预算下只有3个敢放手用。原文稍后读已读值得跟进有用关注 ARC-Challenge