10:09官方账号arXiv cs.AI@Xudong Chen, Shengbo Gong, Lu Cheng, Wei JinProtoCP是一种用于时序交互图边级欺诈检测的共形预测框架,针对欺诈数据中良性邻居主导和类别极度不平衡的问题,通过聚焦欺诈相关子图上下文提升校准效率。该方法利用学习到的原型抑制良性噪声,并引入邻域相对评分与时间分数扩散机制,实现稳定的类别条件校准。在YelpChi、S-FFSD、FTFD和BankSim四个欺诈基准上,ProtoCP以更小的预测集达到目标覆盖率,优于现有最先进基线。代码已开源。论文ProtoCP共形预测欺诈检测推荐理由:欺诈检测要控制误报和漏报,这篇论文的ProtoCP把共形预测用在了时序图上,四个基准上都比现有方法预测集更小,做风控的可以看看。原文稍后读已读值得跟进有用关注 ProtoCP
09:38官方账号arXiv cs.LG@Arash Vashagh, Yasmin VashaghConformalShift 是一种针对自适应心电图监测的有界事件重排攻击。在 MIT-BIH 确认记录上,它不改动波形、标签、分类器分数或事件多重集,只重排真实先前事件来降低目标的心室阈值。攻击对 Extra Trees 和 HistGradientBoosting 的合格目标抑制率分别达到 66.7% 和 60.0%,随机调度仅为 4.4% 和 12.0%。迁移到 INCART 后仍优于随机调度,收缩位移预算削弱了攻击效果。论文ConformalShift对抗攻击心电图监测推荐理由:ConformalShift 攻击心电监测,不改波形和标签,只重排真实事件顺序,成功率从 4.4% 提到 66.7%。原文稍后读已读值得跟进有用关注 ConformalShift
11:15官方账号arXiv cs.AI@Manpreet Singh, Akshatha Srikantha, Shyamal Lakhanpal针对信用评分、欺诈检测等高风险中类别不平衡和不对称错误成本问题,该研究比较了边际共形预测(marginal CP)、类条件共形预测(Mondrian CP)和成本控制弃权机制。在15个真实不平衡数据集、7个分类模型、3种校准方法和10个随机种子下进行3150次实验。结果显示Mondrian CP将少数类覆盖率平均提升61.7个百分点(p<1e-80),而边际CP在某些数据集上少数类覆盖率低至0.5%。结合成本控制弃权还进一步降低了预期决策成本,并量化了将模糊实例交给人类专家判断的盈亏平衡阈值。论文共形预测Mondrian CP成本敏感推荐理由:这论文用海量实验证明,碰到严重不平衡数据时,传统预测区间会漏掉少数类,Mondrian CP加弃权能大幅提升覆盖率和成本效益,做高风险决策的值得看。原文稍后读已读值得跟进有用关注 共形预测
10:55官方一手arXiv: DeepSeek@Mingqiao Mo, Yunlong Tan, Hao Zhang精选SFC是一种基于共形预测的图结构框架,用于自纠正科学生成中的事实性错误。在PhyX多模态物理基准上,SFC达到50.1%的准确率,超过DeepSeek-R1(49.8%)和GPT-4(45.8%)。该框架以91.7%的科学有效性提供形式化共形覆盖保证(置信水平α=0.10),并将科学定律违规率降低73%。SFC通过原子绝对一致事实单元和近似可推导图建模逻辑依赖,在检测到科学违规时动态分支到替代生成路径。AI模型SFC共形预测科学推理推荐理由:想做可靠的科学生成?SFC框架让模型一边写一边用共形预测校验事实,结果比DeepSeek和GPT-4都准,还能少犯73%的科学错误。原文稍后读已读值得跟进有用关注 SFC
09:17官方账号arXiv cs.LG@Yurui Zheng, Ying Jin本文提出了一个用于反事实决策中不确定性量化的决策理论框架。它定义了"策略耦合覆盖"——即预测集诱导行动下实现结果的覆盖。该框架证明了一种自然的最大最小规则是分布模糊下的极小极大最优。它提出了一种两阶段过程Policy-Coupled Risk-Averse Conformal Prediction (PC-RACP),在有限样本下逼近最优集。模拟和真实电子邮件营销实验表明,PC-RACP比现有方法提供更高的效用,同时保持有效覆盖。论文共形预测反事实决策不确定性量化推荐理由:这篇论文解决了决策中如何利用预测不确定性的难题,提出的PC-RACP方法在实验中比现有方法效用更高,值得搞决策优化的同学看看。原文稍后读已读值得跟进有用关注 共形预测
11:34官方账号arXiv cs.LG@Sayan Das, Bahram Yaghooti, Todd A. Kuffner, Soumendra N. Lahiri本文研究分割共形预测中训练集与校准集的最优分割比例,目标是在保持覆盖保证的同时最小化预测区间长度。在一般框架下推导了对称和非对称场景下长度最优分割比的理论刻画,并具体分析了线性回归、非参数回归和神经网络等常见回归设置。提出了一种基于数据的最优比例选择方法,并通过合成和真实数据集实验验证了其适用性。论文Split Conformal Prediction共形预测数据分割推荐理由:这篇论文教你怎么分割数据能让预测区间更短,覆盖了线性回归、神经网络等常见模型,有实操方法。原文稍后读已读值得跟进有用关注 Split Conformal Prediction
09:56官方账号arXiv cs.LG@Clément Fuchs, Tim Bary, Benoît Macq本文对视觉-语言模型(VLMs)在自然图像分类任务上使用局部化共形预测(localized conformal prediction)进行不确定性量化。作者通过开源实现基准测试,发现直接使用测试样本与校准样本视觉特征的余弦相似度并不能优于非局部基线。他们提出一种简单的非线性变换,在保持边缘覆盖保证的同时,实现了统计显著的集合大小平均减少。实验在多个VLM上验证了有效性。论文VLM共形预测不确定性量化推荐理由:这篇论文发现直接用余弦相似度搞局部共形预测效果一般,但换个非线性变换后,预测集变小了,值得做VLM不确定性量化的看看。原文稍后读已读值得跟进有用关注 VLM
15:16官方账号arXiv cs.LG@Nico Daheim, Iryna GurevycharXiv 论文提出基于贝叶斯决策理论和风险规避规则的几种不确定性感知算法,用于大语言模型在辅导和自动同行评审中的决策。在生成导师回复或评审时,将策略与分数的不确定性纳入考量,并用共形预测对策略和分数提供统计保证。实验表明,贝叶斯方法在高模糊性下优于风险规避规则,后者可能因追求通用输出而降低效用。论文LLM贝叶斯决策共形预测推荐理由:这篇论文教大模型在不确定时怎么选策略,辅导学生或写评审都管用,贝叶斯方法比保守方法更聪明。原文稍后读已读值得跟进有用关注 LLM
12:18官方账号arXiv cs.LG@Yannick Limmer论文提出过滤共形椭球(Filtered Conformal Ellipsoids)用于多变量时间序列的联合预测集控制。该方法通过冻结状态空间滤波器生成一步预测均值和协方差,并对马氏距离得分进行分割共形校准。在METRLA-20和PEMSBAY-50图原生交通基准上,学习到的滤波器比静态协方差和非滤波器基线获得更尖锐的目标椭球。分析表明,在稳定贝叶斯高斯投影滤波器下,小超额高斯负对数似然可保证学习发射定律的收敛性。论文GCN-GRUMETRLA-20PEMSBAY-50推荐理由:这篇给时间序列预测搞了新套路,用过滤共形椭球比静态协方差更准,在交通数据集上效果更锐利。原文稍后读已读值得跟进有用关注 GCN-GRU
11:59官方账号arXiv cs.AI@Haimin Hu该论文提出了一种基于共形预测的算法,用于验证交互式机器人中信念空间安全过滤器(BeliefSF)的高概率安全性。传统安全过滤器仅考虑物理空间,而BeliefSF在运行时结合推理主动降低机器人对人行为的不确定性,从而减少过滤的保守性。然而,由于运行时推理误差和神经网络近似的高维性,提供形式化安全保证极具挑战。作者通过聚焦于推理可靠区域进行验证,保留了共形预测的简单性和样本复杂度,同时显著降低了安全过滤器的保守性。在模拟人车交互基准测试中,该方法比标准共形预测基线验证了更宽松的安全过滤器。论文安全过滤器共形预测人机交互推荐理由:做交互式机器人安全验证的团队终于有了兼顾宽松性和形式化保证的方法——BeliefSF结合共形预测,在减少保守性的同时保持样本效率,做自动驾驶或人机协作的开发者值得关注。原文稍后读已读值得跟进有用关注 安全过滤器
12:14官方账号arXiv cs.LG@Hanyang Jiang, Rina Foygel Barber, Ashwin Pananjady, Yao Xie传统共形预测方法依赖数据可交换性和无记忆预测器,这在时间序列中不现实。近期研究表明分割共形预测对时间序列的依赖性和记忆性预测器具有鲁棒性,但分割会降低精度。本文发现原始留一法Jackknife在时间序列中可能严重损失覆盖率,因此提出“留窗口法”(LWO),通过修改Jackknife使其在温和稳定性条件下实现有效覆盖率。实验显示LWO在原始Jackknife失效时仍能保持有效覆盖率,且预测区间比分割共形预测更窄。论文时间序列共形预测Jackknife推荐理由:时间序列预测的置信区间一直是个难题,做时序建模的团队可以试试LWO——它比分割法更高效,也比原始Jackknife更可靠,值得在ARIMA或LSTM上跑一跑。原文稍后读已读值得跟进有用关注 时间序列
11:26官方账号arXiv cs.AI@William Overman, Mohsen Bayati精选论文提出校准集体监督(CCO)方法,通过聚合多个辅助评分函数形成惩罚项,衡量AI行为对保守基线的偏离。CCO受可达到效用保留启发,实现集体保守主义:当监督者认为行为无异议时,高效用行为仍被选中,仅在担忧累积时被覆盖。该方法利用共形决策理论在线校准保守程度,确保不良结果低于用户指定阈值,且无需分布假设。在修改版SWE-bench上,较弱监督者成功约束了对抗性更强的智能体;在MACHIAVELLI环境中,CCO在保持奖励的同时大幅减少伦理违规。论文AI安全可扩展监督共形预测推荐理由:这篇论文解决了超人类AI系统的监督难题,做AI安全和对齐的研究者可以直接参考其理论保证和实验验证。原文稍后读已读值得跟进有用关注 AI安全
10:13官方账号arXiv cs.AI@Yuxuan Gao, Megan Wang, Yi Ling Yu精选该研究将分裂共形预测和自适应共形推断(ACI)应用于连续AI智能体评估,提供无分布假设的覆盖保证。在24小时预测窗口内,共形区间在所有名义水平上的校准误差低于0.02,ACI在智能体发布后正确将区间扩大35%后重新收敛。研究还开发了多智能体管道的组合不确定性界限、成对排名的共形弃权规则(控制假排名率)以及排行榜级多重检验的FDR校正弃权。通过每小时收集18个实时信号评估50个智能体,发现每个智能体的条件覆盖集中在名义水平附近(均值80.4%,90%的智能体在[72%,90%]内),跨来源情感分歧可预测排名不稳定性(r=0.64, p<0.01)。代码和数据已以CC BY 4.0协议发布。论文AI智能体评估不确定性量化共形预测推荐理由:做AI智能体评估或排行榜的团队终于有了统计严谨的不确定性量化工具——无需分布假设即可保证覆盖,还能处理多智能体管道和排名稳定性问题,建议做评估基准的开发者直接看论文和代码。原文稍后读已读值得跟进有用关注 AI智能体评估
10:59官方账号arXiv cs.LG@Samuele Bortolotti, Emanuele Marconato, Andrea Pugnana, Andrea Passerini, Stefano Teso精选神经符号概念模型(NeSy-CBMs)结合神经网络与符号推理,适用于高风险场景,但其预测可能过于自信。研究者引入共形预测(CP)框架,提出三个理想目标:一致性、覆盖率和简洁性。现有方法无法同时满足这些目标,因此他们提出COCOCO,一种事后框架,联合共形化概念和标签,并通过演绎-溯因修正步骤协调两者。COCOCO满足所有三个目标,保持无分布覆盖率,对不完美知识具有鲁棒性,并支持用户指定的大小预算。在8个数据集上的实验表明,COCOCO在性能和集合大小方面优于竞争对手和基线方法。论文共形预测神经符号模型概念模型推荐理由:这项研究解决了高风险AI应用中模型过度自信的痛点,做可解释AI或安全关键系统的团队可以直接参考COCOCO框架来提升预测可靠性。原文稍后读已读值得跟进有用关注 共形预测
10:39官方账号arXiv cs.LG@Paulo C. Marques F., Helton Graziadei精选本文提出了一种偏态自适应共形预测方法,用于回归任务。该方法从以点预测为中心的非对称区间族出发,利用规范方法推导出该区间族诱导的一致性得分。通过对带符号的缩放残差进行逆双曲正弦变换,作为额外预测模型的训练目标,该模型学习预测不确定性如何在特征空间中倾斜。该方法在可交换性假设下保留了分割共形预测的有限样本边际有效性,同时生成适应局部尺度和局部偏态的区间。实验表明,与缩放得分构造和共形分位数回归相比,该方法在预测区间效率上有所提升,且提出的估计器能准确匹配测试样本上的平均宽度比。论文共形预测回归不确定性量化推荐理由:做回归预测且需要不确定性量化的团队,这篇论文提供了一种能自适应数据偏态的新方法,比传统共形预测区间更高效,值得关注。原文稍后读已读值得跟进有用关注 共形预测
11:42官方账号arXiv cs.LG(学术论文)GRAPHLCP是一种用于图神经网络(GNN)的局部化共形预测框架,能够提供分布无关的不确定性量化保证。现有方法仅依赖嵌入空间邻近性进行局部化,但对图结构不可靠且效率低。GRAPHLCP通过特征感知致密化缓解稀疏图局部偏差,利用个性化PageRank核建模拓扑邻近性,从而捕获局部和长程依赖。实验表明,该方法在有限样本下保证边际覆盖率,并在多种回归和分类数据集上实现高效的测试条件覆盖率。论文图神经网络不确定性量化共形预测推荐理由:该工作将图拓扑显式融入共形预测的局部化过程,解决了图场景下传统方法嵌入邻近性不可靠的问题,为图神经网络的可靠不确定性量化提供了新方案,对需要鲁棒预测的图应用(如分子性质预测、社交网络分析)具有实用价值。原文稍后读已读值得跟进有用关注 图神经网络