10:34官方账号arXiv cs.LG@Daniel Perkins, John Squires, Janou Milligan, Chandra Raskoti, Linda Ungerboeck论文提出ARMDIL,一种使用多模态大语言模型(MLLM)作为自适应路由器的图像分类集成方法。该集成包含ResNet、自监督学习(SSL)和视觉语言模型(VLM)等视觉骨干,在统一标签空间上训练。实验显示,ARMDIL与专用的训练型路由器性能相当,同时能通过简单提示修改快速整合新信息。该方法用自然语言推理轨迹增强可解释性,为通用视觉系统提供支持。论文ARMDILMLLM图像分类推荐理由:这篇论文搞了个ARMDIL,用MLLM当路由器给图像挑合适的视觉模型,效果不输专门训练的,还能改提示词加新数据。原文稍后读已读值得跟进有用关注 ARMDIL
09:54官方一手arXiv: DeepSeek@Yurong Liu, Yeye He, Haoyu Dong, Junjie Xing, Shi Han, Dongmei Zhang, Surajit ChaudhuriAuto-Fill提出后训练三个专业小语言模型(SLM),分别专精世界知识、文本推理和代码推理,并通过校准集成机制动态选择最自信的专家或弃权。在11个基准数据集、2200个真实表格上的实验显示,Auto-Fill的准确率超过了o3-pro、Gemini 3 Pro和DeepSeek R1等前沿推理模型。其推理成本不到这些模型的1%。Auto-Fill已开源(GitHub)。论文Auto-Fill小语言模型表格数据推荐理由:三个专精小模型组队填表格空值,比大模型还准,成本只要1%——这篇论文值得看。原文稍后读已读值得跟进有用关注 Auto-Fill
10:57官方账号arXiv cs.LG@Meher Sai Preetam, Meher Bhaskar本文提出 Simplex-Constrained Sparse Bagging (SCSB),一种用于后训练压缩和概率校准的数学框架。标准 Bagging 集成(如随机森林、Bagged SVM 等)对所有基估计器赋予均匀投票权重,忽略了它们在不同区域的局部能力差异,导致模型过度自信。SCSB 通过在概率单纯形上最小化袋外损失,将集成剪枝和校准联合优化,并引入凹二次惩罚解决 L1 单纯形悖论(L1 范数在单纯形上为常数,无法直接剪枝)。该方法与模型无关,可实现高达 96% 的集成压缩,带来线性推理加速,同时降低期望校准误差,保持或提升泛化精度。论文集成学习模型压缩概率校准推荐理由:做集成学习或模型部署的团队,SCSB 能帮你把随机森林等 Bagging 模型压缩 96% 且校准更好,直接省推理成本。原文稍后读已读值得跟进有用关注 集成学习
14:31官方账号arXiv cs.AI@Aditya Tanna, Yash Desai, Pratinav Seth, Mohamed Bouadi, Nassim Bouarour, Vinay Kumar Sankarapu精选一项新研究评估了六种现代表格基础模型(TFM)在153个OpenML分类任务上的集成效果。结果显示,这些模型高度冗余,平均成对Q统计量达0.961,接近1,导致任何凸组合的性能提升有限。最佳集成策略(两级级联堆叠)仅比最强单模型提升0.18%准确率,但计算成本增加253倍。统计检验表明,三种集成策略与最佳单模型处于同一等价组,而其他三种集成甚至显著更差。逻辑回归元学习器虽然提升了准确率和ROC-AUC,但严重破坏了校准,导致对数损失最差。研究建议实际应用中优先使用贪心选择策略。论文表格基础模型集成学习校准推荐理由:做表格数据建模的团队会发现,盲目集成TFM可能得不偿失——计算成本飙升但收益微乎其微,甚至可能破坏模型校准。建议点开看看,避免踩坑。原文稍后读已读值得跟进有用关注 表格基础模型