11:34官方账号arXiv cs.LG@Mingyuan Zhang该论文研究多标签分类中逐样本Jaccard分数(IoU)的校准维度。作者证明Jaccard损失、平移损失和普通损失矩阵均非奇异,损失列仿射维度为2^s−1。精确校准的凸校准维度满足2^{s−1} ≤ CCdim ≤ 2^s−1,因此任何精确校准的凸代理都需要指数多个预测坐标。针对固定误差容忍度,论文给出多项式维度近似:F1到Jaccard的转移在维度s^2+1下达到至多3−2√2的渐近遗憾;MinHash平方损失代理在维度O((s^2+s log(1/ρ))/α^2)下达到遗憾上界α。论文JaccardMinHash多标签分类推荐理由:做多标签分类调Jaccard的同学看看:精确校准要指数维度,但固定误差容忍度有多项式解法,MinHash思路挺巧。原文稍后读已读值得跟进有用关注 Jaccard
18:24官方账号arXiv cs.LG@Nguyen Thai Anh, Truong Viet Vu, Tran Thien Thanh, Vo Nguyen Quoc Bao, Ngo Hoang TuHEB-NB通过Type-II最大似然学习Dirichlet先验浓度,实现数据自适应的平滑,解决了Laplace等固定平滑在高基数数据上的偏差问题。理论证明其非渐近误差界匹配经验分布极小极大率,并给出有限样本风险级严格优于Laplace的证明。在31个UCI和OpenML基准上,HEB-NB取得最佳平均Friedman排名,高基数数据集对数损失降低达22.1%。HEB-AODE扩展也一致优于原始AODE。结合互信息加权,top-1 ECE降低41%-70%。论文HEB-NBNaive Bayes经验贝叶斯推荐理由:如果你用朴素贝叶斯处理高基数分类数据,HEB-NB能自动调平滑参数,比固定Laplace更准,论文还给了理论保证和实测数据。原文稍后读已读值得跟进有用关注 HEB-NB
02:26lmarena.ai@lmarena_ai精选斯坦福博士生与Arena研究员@carrieeeeet提出一套框架,在历史任务上校准合成数据,避免依赖当前任务的真实标签。该方法覆盖社会科学调查、AI评估和Agent Arena排行榜早期信号,处理源于模型、时间和环境变化的系统偏差。核心通过任务可交换性(Task Exchangeability)从相邻任务学习,World Cup案例用于解释原理。案例还包括Bradley-Terry/AutoRater评分和Agent Leaderboard上的可操控性分数。论文Agent Arena合成数据校准推荐理由:斯坦福Carrie的新框架,用历史任务校准合成数据,不需要真实标签,Agent Arena也在用,能解决模型和时间带来的偏差。原文稍后读已读值得跟进有用关注 Agent Arena
13:13官方账号arXiv cs.AI@Cesare Zavattari, Alessandro Tommasi, Giuseppe Prencipe一篇arXiv论文研究单人对N个LLM智能体舰队在每轮预算B≪N次审计下的监督问题,依据自我报告置信度排序,但置信度可能被对抗性错误校准且误差相关。作者用双层高斯Copula建模,找到了错误校准阈值δ*,超过该阈值后按置信度排序审计比随机审计更差。两个先验预期被推翻:预算越少δ*反而越高,跨家族相关性并不低——共享难度主导了谱系。五个开源模型置信度近乎恒定、无操作价值,点估计处于或超过翻转点但置信区间跨越;一个专有模型有信息量且落在阈值以下。论文还给出了“空洞监督”的定量判据,并通过历史轨迹回放验证了排序。论文LLM智能体审计推荐理由:这篇论文用数学告诉你,LLM自报置信度不靠谱时,按置信度排序审计可能比随机还差,而且越省预算越危险,值得做AI治理的人看看。原文稍后读已读值得跟进有用关注 LLM
11:54官方账号arXiv cs.LG@Shreyas Pradeepkumar Khandale精选Ishida等人提出的软标签贝叶斯误差估计器β(z)=E[min(z,1-z)]在概率并非真实后验时会产生严重偏差。研究证明温度缩放会导致代理值与真实误差完全脱钩:固定分类器在CIFAR-10、Fashion-MNIST和SVHN的8个二分类任务上,0-1误差不变,代理值可变化56倍至980倍。理论推导表明温度与代理值之间存在连续双射,使同一分类器能报告(0,1/2)区间内的任意代理值。在Logits服从高斯分布时,作者给出了代理-温度曲线的闭式参数解,经验拟合误差小于0.018。校准温度(最小化ECE)与稳定的代理值没有对应关系。论文温度缩放贝叶斯误差代理校准推荐理由:这篇论文把校准里的一个坑讲透了:温度缩放能让同一个模型输出任意低的代理误差,但实际错误率根本没变,数值能差几百倍。做不确定性估计的一定要看。原文稍后读已读值得跟进有用关注 温度缩放
09:05官方账号arXiv cs.LG@Jijie Zhang, Zhe Ren, Quan Zhang, Dandan GuoDALorRA利用变分贝叶斯稀疏框架,对LoRA的低秩分解中的每个秩分量施加随机掩码,从而引入贝叶斯正则化。该方法将不确定性估计从高维参数空间转移到轻量级的秩空间,实现高效校准。实验结果显示DALorRA在不牺牲推理准确性的前提下,有效减轻了LLM的过度自信问题。论文DALorRALoRALLM推荐理由:DALorRA让LLM微调不再过度自信,用稀疏低秩适应提升校准,还不损失推理能力。原文稍后读已读值得跟进有用关注 DALorRA
09:29官方一手arXiv: DeepSeek@Zewen Liu该论文首次研究评估器校准作为缓解方法,对DeepSeek-V4-Pro执行器和GLM5.2评估器进行受控实验。结果显示,校准将耦合系数gamma降低20-49%,Jensen-Shannon散度降低45-67%。对称LR控制实验确认效果并非来自更新不对称性减少。作者发布了校准TTRL协议,推荐作为轻量级缓解方案。论文DeepSeek-V4-ProGLM5.2TTRL推荐理由:这篇论文实验发现,对评估器做概率校准能把偏好耦合降低20-49%,效果显著,推荐给做LLM评估管线的朋友。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Pro
13:46官方账号arXiv cs.AI@Ziwei Su, Junyu Ren, Victor Veitch该论文研究了对比嵌入模型中,尽管训练损失是尺度不变的且通常使用余弦相似度,但嵌入向量的范数(norm)却意外地与概念特异性、词频和人类不确定性等语义属性相关。作者通过分析优化动力学,推导出一个解析公式,证明嵌入长度作为训练过程的副产品自然地编码了这些信息。研究还展示了这种信号如何在特定模型和检索任务中作为“免费”校准工具使用,为之前仅基于经验的观察提供了理论解释。论文对比嵌入嵌入范数语义特异性推荐理由:一篇理论论文,解释了为什么对比嵌入模型的向量长度能反映语义,以后做检索任务可以白捡校准信号。原文稍后读已读值得跟进有用关注 对比嵌入
09:45官方账号arXiv cs.AI@Md Omar Faruk Rokon, Shasvat Desai, Hong Yao, Kuang-chih Lee论文提出校准模型级联方法,通过路由查询至逐步更大的微调分类器,在赞助搜索中高效生成相关性标注。微调贡献20个准确率点,级联几乎不影响准确率但将计算成本减半。逐类等渗校准带来+0.6个点的统计显著提升。系统在生产中处理了1.5亿+标注,加速实验周期。论文AutoRelAnnotator相关性标注模型级联推荐理由:这篇论文教你怎么用级联模型做标注,既省成本又保精度,实测处理了1.5亿条数据。原文稍后读已读值得跟进有用关注 AutoRelAnnotator
11:40官方账号arXiv cs.AI@Gina Wong, Drew Prinster, Suchi Saria, Rama Chellappa, Anqi Liu该论文研究混合专家模型在分布偏移下的校准问题。先前工作表明专家级校准可提升MoE模型的准确率和校准度。本文发现硬路由模型中专家校准足以保证整体校准,但软路由模型则不足。对此提出对抗性重新加权方法,惩罚分布偏移下路由聚合的校准误差。实验证明该方法能改善平均及困难子集上的准确率-校准权衡。论文MoE分布偏移校准推荐理由:这篇论文把MoE的校准问题研究透了,告诉你硬路由和软路由有什么区别,还给了一个对抗性重加权的解法。原文稍后读已读值得跟进有用关注 MoE
09:22官方账号arXiv cs.LG@Eric Nalisnick, Chi Zhang, Sophia Qian, Yixin Wang精选这篇论文从统计校准的角度研究人类与AI的团队协作模型。假设团队由AI模型和人类组成,两者都基于特征空间的某种划分进行了校准,论文揭示了校准假设如何影响团队协作框架。研究考虑了两种框架:一是结合人类和模型的预测,二是将预测责任委托给人类或模型。理论和实验结果表明,现有的组合方法无法保持人类的校准程度;而委托方法虽然保留了预测者的校准,但将负担转移到了决定谁预测的拒绝元模型上。拒绝元模型需要足够精细的校准以定位每个成员的优越区域,这种需求随着人类专业知识的增加而增长,当人类依赖系统无法观察的信息时,这种校准变得不可实现。论文人机协作校准统计学习推荐理由:这篇论文为设计更可靠的Human-AI协作系统提供了理论基石,做AI系统设计或人机交互研究的团队值得关注,能帮你理解校准假设如何影响团队决策的可靠性。原文稍后读已读值得跟进有用关注 人机协作
10:03官方账号arXiv cs.LG@Rouaa Hoblos, Noura Dridi, Noureddine Zerhouni, Zeina Al Masry传统神经网络缺乏不确定性估计能力,而贝叶斯神经网络计算复杂。蒙特卡洛 Dropout 通过多次随机前向传播近似贝叶斯推理,但不确定性表示不够精细。本文提出将 Dirichlet 分布框架集成到 MC Dropout 中,利用 Sensoy 等人的方法建模类别概率,从而获得更丰富的不确定性信息。该方法在保持 MC Dropout 计算效率的同时,显著提升了不确定性估计的校准质量。实验表明,该方法能生成良好校准的不确定性估计,为不确定性感知的深度学习提供了实用方案。论文不确定性估计MC DropoutDirichlet分布推荐理由:做模型可靠性或安全关键应用的团队,终于有了一个既高效又精准的不确定性量化工具——在 MC Dropout 基础上加 Dirichlet 分布,校准效果更好,值得在分类任务中试试。原文稍后读已读值得跟进有用关注 不确定性估计
14:31官方账号arXiv cs.AI@Aditya Tanna, Yash Desai, Pratinav Seth, Mohamed Bouadi, Nassim Bouarour, Vinay Kumar Sankarapu精选一项新研究评估了六种现代表格基础模型(TFM)在153个OpenML分类任务上的集成效果。结果显示,这些模型高度冗余,平均成对Q统计量达0.961,接近1,导致任何凸组合的性能提升有限。最佳集成策略(两级级联堆叠)仅比最强单模型提升0.18%准确率,但计算成本增加253倍。统计检验表明,三种集成策略与最佳单模型处于同一等价组,而其他三种集成甚至显著更差。逻辑回归元学习器虽然提升了准确率和ROC-AUC,但严重破坏了校准,导致对数损失最差。研究建议实际应用中优先使用贪心选择策略。论文表格基础模型集成学习校准推荐理由:做表格数据建模的团队会发现,盲目集成TFM可能得不偿失——计算成本飙升但收益微乎其微,甚至可能破坏模型校准。建议点开看看,避免踩坑。原文稍后读已读值得跟进有用关注 表格基础模型
19:12官方一手arXiv: DeepSeek@Jinyuan Wang, Ningyuan Deng, Yi Yang精选大型语言模型(LLM)越来越多地被用于社会科学研究,将非结构化文本转换为可进入实证设计的变量。但研究发现,LLM的置信度与真实正确率严重不匹配,导致基于置信度过滤会扭曲下游回归估计。研究对GPT-5-mini、DeepSeek-V3.2等14个社会科学构念进行审计,发现所有模型都存在校准偏差。作为解决方案,提出软标签蒸馏管道,将LLM得分和置信度转化为软目标分布,训练小型判别分类器,平均降低ECE 43.2%和Brier 34.0%。研究呼吁将校准视为测量有效性的组成部分,而非可选的后期处理。论文LLM社会科学校准推荐理由:做社会科学量化分析的团队终于有了校准LLM输出的实操方案——软标签蒸馏能显著降低置信度偏差,建议做文本编码和实证研究的点开看看具体方法。原文稍后读已读值得跟进有用关注 LLM