11:15官方账号arXiv cs.LG@Jianru Shen精选该研究评估了11个指令微调模型在ARC-Challenge和TruthfulQA上的25,168次预测,参数规模从0.5B到14B。理论证明严格单调校准可保持风险覆盖前沿和错误检测AUROC,而温度缩放无法校准置信度恒高于准确率的模型。Clopper-Pearson方法可将200题校准集转化为有限样本风险证书。实证显示8/22个模型-任务对逼近温度缩放不可行下限,Platt缩放将ECE降至0.02。20%风险预算下仅3个模型-任务对获得认证自主权,10%预算下为零,并修复了TruthfulQA多项选择的答案顺序伪影。论文ARC-ChallengeTruthfulQA不确定性校准推荐理由:这篇论文测了11个小模型,发现温度缩放有校准不了的边界,用200道题就能算风险上限,20%风险预算下只有3个敢放手用。原文稍后读已读值得跟进有用关注 ARC-Challenge
09:29官方账号arXiv cs.LG@Sirine Ayadi, Sándor Daróczi, Stephan Günnemann, Bertrand Charpentier该论文系统评估了量化LLM在2、3、4、8比特位宽下的可靠性,涵盖不确定性、校准和鲁棒性三个维度,使用了六种不同量化方法。研究发现,模型性能随总比特数单调提升,但可靠性缩放呈非线性,4比特量化模型达到可靠性峰值。实验还表明,量化增强了LLM对字符级和词级自然扰动的鲁棒性。论文LLM量化可靠性推荐理由:论文用实验告诉你,4比特量化的LLM最靠谱,比8比特还稳,想省资源又想要可靠性可以照这个选。原文稍后读已读值得跟进有用关注 LLM
19:12官方账号arXiv cs.AI@William Parris这篇论文提出“语义奖励崩塌”(SRC)概念,指在 RLHF 和偏好优化中,不同语义类别的评估不满(如事实错误、不确定性披露、格式不满等)被压缩成通用优化信号,导致模型倾向于抑制可见的不确定性而非保持校准的完整性。作者认为,当前自适应推理系统在泛化评估压力下,可能产生表演性自信、幻觉连续性、校准漂移、谄媚等行为,这些是优化后果而非欺骗。论文借鉴制度代理崩溃、指标博弈、软件可靠性工程等理论,主张将不确定性披露和升级行为视为受保护的认知行为。最后提出“宪法奖励分层”(CRS)框架,作为可测试的治理导向研究方向。论文RLHF/偏好优化AI安全/对齐不确定性校准推荐理由:这篇论文点出了 RLHF 优化的结构性隐患——模型越优化越不敢说“不知道”,做 AI 安全和对齐的研究者、模型训练工程师值得细读,看完会对当前偏好优化的代价有更深理解。原文稍后读已读值得跟进有用关注 RLHF/偏好优化