11:15官方账号arXiv cs.AI@Manpreet Singh, Akshatha Srikantha, Shyamal Lakhanpal针对信用评分、欺诈检测等高风险中类别不平衡和不对称错误成本问题,该研究比较了边际共形预测(marginal CP)、类条件共形预测(Mondrian CP)和成本控制弃权机制。在15个真实不平衡数据集、7个分类模型、3种校准方法和10个随机种子下进行3150次实验。结果显示Mondrian CP将少数类覆盖率平均提升61.7个百分点(p<1e-80),而边际CP在某些数据集上少数类覆盖率低至0.5%。结合成本控制弃权还进一步降低了预期决策成本,并量化了将模糊实例交给人类专家判断的盈亏平衡阈值。论文共形预测Mondrian CP成本敏感推荐理由:这论文用海量实验证明,碰到严重不平衡数据时,传统预测区间会漏掉少数类,Mondrian CP加弃权能大幅提升覆盖率和成本效益,做高风险决策的值得看。原文稍后读已读值得跟进有用关注 共形预测
11:44官方账号arXiv cs.LG@Gabriel Singer, Samuel Gruffaz, Olivier Vo Van, Nicolas Vayatis, Argyris Kalogeratos该研究针对众包标注中的类别不平衡问题,提出一种生成式聚合模型,同时建模项目难度与类别相关的标注者能力。模型在33个真实众包数据集上评估,涵盖图像和文本等多分类任务,以及大规模标注和大规模项目两种场景。实验表明,模型在少数类召回率上持续保持最高,同时平衡精度具有竞争力。论文众包标注不平衡分类少数类检测推荐理由:想处理众包标注中的少数类检测?这篇论文的新模型在33个数据集上召回率都最高,值得看看。原文稍后读已读值得跟进有用关注 众包标注
11:45官方账号arXiv cs.LG@Parth Upman, Shreyank N GowdaQC-SMOTE提出一种质量控制过采样框架,通过复合邻域信任度评分估计少数类样本可靠性。生成候选样本时采用IPQ引导的最佳K策略,评估中点纯度并考虑多数类清除。方法根据重叠-不平衡程度自适应调整插值范围和选择标准。在30个不平衡数据集上的重复分层交叉验证显示,QC-SMOTE在平均AUC-ROC和Macro F1上优于对比过采样方法,在中度和严重不平衡下提升尤为明显。论文QC-SMOTESMOTE不平衡分类推荐理由:这篇论文提出了QC-SMOTE,在30个数据集上比传统SMOTE获得更好的AUC和F1分数,特别适合处理中度到高度不平衡的数据。原文稍后读已读值得跟进有用关注 QC-SMOTE