11:39官方账号arXiv cs.LG@Bin Li, Dongdong Wang, Siyang Lu研究显示,基于语言模型的日志异常检测器在严重类别不平衡情况下对错误预测过度自信。作者提出LoRD校准框架,通过从正确分类的验证样本中学习预测路径特定可靠性模型。在四个大规模日志基准数据集上的实验表明,LoRD显著提高了置信度可靠性,减少了过度自信的异常相关错误,同时保持了异常检测性能。论文LoRDlog anomaly detection模型校准推荐理由:研究人员发现日志异常检测器过度自信问题,提出LoRD框架能有效校准模型,提高系统可靠性。原文稍后读已读值得跟进有用关注 LoRD
09:13官方账号arXiv cs.LG@Abderaouf Bahi这篇论文给出了图神经网络(GNN)在分布偏移下校准的第一个闭式理论表征,发现校准由单个标量决定,该标量依赖于源图与目标图之间的结构变化和特征质量。理论精确识别了模型何时过度自信、欠自信或保持校准,并直接导出了最优温度缩放策略。作者将分析扩展到对称归一化的图卷积网络、多分类和协变量偏移,导出了期望校准误差的理论上界。基于这些洞察提出了无需源域标签的STAC方法,在合成基准上校准显著提升,但在五个真实世界图数据集上不依赖目标标签的可靠校准仍具挑战。论文GNNSTAC分布偏移推荐理由:这篇论文把GNN在数据分布变了之后到底准不准、慌不慌讲透了,还给出了一个不用标签的校准方法STAC,做图模型部署的值得一看。原文稍后读已读值得跟进有用关注 GNN
10:41官方账号arXiv cs.AI@Gabrielle Kaili-May Liu, Avi Caciularu, Gal Yona, Idan Szpektor, Arman Cohan大型语言模型在表达不确定性时存在高置信度幻觉、无法识别知识边界等问题。论文提出强化学习与元认知反馈(RLMF)范式,利用模型自我判断质量来优化偏好排序。在忠实校准任务上,RLMF比标准强化学习提升最多63%。方法还包含元认知数据选择,优于朴素主动学习。实验表明RLMF在多种任务上达到最先进性能。论文RLMFLLM元认知推荐理由:这篇论文提出了RLMF方法,让LLM学会说“我不知道”,比普通RL方法效果提升63%,解决了模型过度自信的问题。原文稍后读已读值得跟进有用关注 RLMF
10:56官方账号arXiv cs.LG@Xin Ci Wong, Duygu Sarikaya, Kieran Zucker, Marc De Kamps, Nishant Ravikumar该论文评估了蒙特卡洛丢弃法(MC Dropout)在脑肿瘤分割中识别错误的能力。在126例BraTS21患者上测试了SegResNet和UNet-Res两个模型,MC Dropout保持了分割精度(|ΔDice|<0.01),且不确定性-误差对齐AUROC(熵H)约0.97。但全局对齐掩盖了区域差异:UNet-Res在增强肿瘤亚区域的熵仅为0.054,期望校准误差(ECE)达0.915,Dice仅0.714,显示严重误校准。标准Dice和AUROC无法检测这一失败模式。论文MC Dropout不确定性估计脑肿瘤分割推荐理由:这篇论文用具体数据告诉你,模型Dice高不一定安全,得看关键区域的校准情况。做医疗AI必读。原文稍后读已读值得跟进有用关注 MC Dropout