AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

小型语言模型

共 1 条相关 AI 资讯
8月6日
11:15
11:15官方账号arXiv cs.LG@Jianru Shen
精选
该研究评估了11个指令微调模型在ARC-Challenge和TruthfulQA上的25,168次预测,参数规模从0.5B到14B。理论证明严格单调校准可保持风险覆盖前沿和错误检测AUROC,而温度缩放无法校准置信度恒高于准确率的模型。Clopper-Pearson方法可将200题校准集转化为有限样本风险证书。实证显示8/22个模型-任务对逼近温度缩放不可行下限,Platt缩放将ECE降至0.02。20%风险预算下仅3个模型-任务对获得认证自主权,10%预算下为零,并修复了TruthfulQA多项选择的答案顺序伪影。
论文ARC-ChallengeTruthfulQA不确定性校准

推荐理由:这篇论文测了11个小模型,发现温度缩放有校准不了的边界,用200道题就能算风险上限,20%风险预算下只有3个敢放手用。
原文
精选全部日报登录