11:39官方账号arXiv cs.LG@Nour Shaheen, Junwei Ma, Alex Labach, Frank Hutter, Valentin Thomas, Anthony L. Caterini研究显示,表格基础模型(TFMs)通过单表格自监督预训练即可实现强迁移能力。表格的有用性取决于特征数量而非实例数量,且与下游任务无关。列级预处理能持续提升下游性能,而数据集级别的过滤或去重则无改善。研究认为TFMs的泛化主要基于检索机制,模型需学会识别相关示例并进行有效聚合。论文表格基础模型自监督学习迁移学习推荐理由:这篇论文揭示了表格基础模型如何通过单表格预训练实现强迁移,颠覆了传统大规模数据训练的认知。原文稍后读已读值得跟进有用关注 表格基础模型
09:32官方账号arXiv cs.LG@Yi He, Zhengkang Guan, Anpeng Wu, Peng Cui, Fei Wu, Kun KuangSkillTFM提出一种无需训练的表格基础模型(TFM)适配系统,将参数更新转变为智能体技能的门控演化。其核心是可验证的技能库,结合边界证据识别与门控技能演化,无需微调或额外标注数据即可应对分布偏移。在模拟边界设置和真实电价预测任务中,SkillTFM将AUC提升0.128至0.142,非线性边界AUC从0.699升至0.898。跨多个TFM骨干网络的实验验证了该方法的有效性和通用性。论文SkillTFM表格基础模型免训练适配推荐理由:表格模型遇到数据偏移不用微调,SkillTFM靠技能库自动适配,AUC最多涨0.14,一篇很实用的论文。原文稍后读已读值得跟进有用关注 SkillTFM
11:32官方账号arXiv cs.LG@Malena Loza, David Chushig-Muzo, Eva Milara, Luis Bote-Curiel, Luis Estrada-Petrocelli, Felipe Grijalva论文评估了9种表格基础模型(TabPFNv2、TabICL、Mitra等)在分布偏移下的表现。使用了HELOC、Voting和Childhood Lead三个真实数据集,涵盖标签、社会经济和地理偏移类型。结果显示所有模型性能均系统性下降,偏移差距在0.003到0.060之间,且高性能模型需要大幅计算资源。论文TabPFNTabICL表格基础模型推荐理由:想知道表格模型换了数据还灵不灵?这篇论文测了9个主流模型,结果全都不乐观,性能差距最小也有0.003。原文稍后读已读值得跟进有用关注 TabPFN
11:35官方账号arXiv cs.LG@Joscha Cüppers, Jilles Vreeken本文提出MASHT方法,将MultiRocket和Hydra随机卷积特征与预训练表格基础模型结合,完全跳过任务特定训练。在单变量时间序列分类上,MASHT的平均排名低于HIVE-COTE 2.0。在多变量数据集上,MASHT与最强基准方法竞争激烈。实验表明该方法无需训练即可匹配领先结果。论文MASHTMultiRocketHydra推荐理由:想不训练模型就做时间序列分类?试试MASHT,把MultiRocket特征丢给表格基础模型,单变量任务已经干掉HIVE-COTE 2.0了。原文稍后读已读值得跟进有用关注 MASHT
09:47官方账号arXiv cs.LG@Zeynep Türkmen, Kürşat Kaya, Alexander Pfefferle, Frank Hutter该研究提出一个统一接口,用于比较不同表格基础模型的数据先验。他们从TabPFN、TabR等公开先验和真实数据集生成训练任务,在固定架构和训练协议下训练模型。在共享下游分类任务上评估发现不同先验偏好不同任务特性,部分先验绝对性能更强,部分排序更稳定。数据级相似度仅能部分解释下游行为差异。论文表格基础模型数据先验评估方法推荐理由:想知道不同表格基础模型的数据先验到底差多少?这篇论文用统一框架帮你测了一遍,结果挺有意思。原文稍后读已读值得跟进有用关注 表格基础模型
09:49官方账号arXiv cs.AI@Minh-Khoi Pham, Luca Cotugno, Alina Sirbu, Tai Tan Mai, Martin Crane, Marija Bezbradica精选该研究提出了一种轻量级适配方法,将表格基础模型(如TabPFN、TabDPT、TabICL)应用于临床生存分析,通过直接训练一个生存感知头(MTLR)来预测右删失的时间事件结果。在多个公开生存基准和两个大规模ICU队列(MIMIC-IV和eICU)上的评估显示,该方法在C-index指标上优于传统深度生存模型(如DeepSurv),相对提升达1.4%-1.7%。这表明预训练表格表示与生存感知目标的结合为临床生存预测提供了实用且有效的替代方案。论文表格基础模型生存分析临床决策推荐理由:临床研究人员和医疗AI开发者终于有了一个无需从头训练就能做生存分析的方案——用表格基础模型加一个轻量头就能超越DeepSurv,做ICU预后预测的团队可以直接在MIMIC-IV和eICU上复现。原文稍后读已读值得跟进有用关注 表格基础模型
10:53官方账号arXiv cs.LG@Oroel Ipas, Guillermo Gomez-Trenado, Rocío Romero-Zaliz, Isaac Triguero精选在低标注表格学习场景中,如何选择标注实例是关键挑战。对于TabPFN等表格基础模型,上下文选择直接影响预测性能。有监督实验表明,精心选择的标注集能显著优于随机选择。但冷启动场景(无标签时选择实例)研究不足。LUCoS方法利用无监督预训练网络的潜在几何结构选择代表性样本作为上下文,在67个数据集上平均AUC、ACC和F1排名第一。该方法通过覆盖度和表示空间的选择机制,有效避免了原始特征空间选择失效的问题。论文表格基础模型无监督学习上下文选择推荐理由:做表格数据标注或低资源学习的团队,LUCoS解决了冷启动下上下文选择的核心难题,无需标签就能显著提升模型效果,值得在TabPFN等模型上试试。原文稍后读已读值得跟进有用关注 表格基础模型
11:46官方账号arXiv cs.AI@Xu Yao, Siyuan Zhou, Wu Zhenbo, Chaochuan Hou, Shuang Liang, Shiping wang, Hailiang Huang, Songqiao Han, Minqi Jiang精选弱监督异常检测(WSAD)长期分为不完整、不精确和不准确三种监督方向,但缺乏统一评估框架。该论文提出WSADBench,首个跨场景统一基准,系统评估了36种算法在4种模态下的表现,基于超过70万次实验。研究发现:弱监督场景间存在强相关性,挑战了当前研究方向的孤立性;专用WSAD算法仅在极端标签稀缺时占优,随监督增强或面对分布外数据时,表格基础模型和通用分类方法迅速超越;无标签数据在不同设置下效用不一致,相比标签精炼收益有限;模型对不同类型标签噪声的敏感性不对称。该基准已开源,旨在推动WSAD研究。论文弱监督学习异常检测基准/评估推荐理由:做异常检测或弱监督学习的团队终于有了统一评估工具——WSADBench用70万次实验戳破了三个方向各自为战的假象,看完你会重新思考该用专用算法还是通用模型。原文稍后读已读值得跟进有用关注 弱监督学习
14:31官方账号arXiv cs.AI@Aditya Tanna, Yash Desai, Pratinav Seth, Mohamed Bouadi, Nassim Bouarour, Vinay Kumar Sankarapu精选一项新研究评估了六种现代表格基础模型(TFM)在153个OpenML分类任务上的集成效果。结果显示,这些模型高度冗余,平均成对Q统计量达0.961,接近1,导致任何凸组合的性能提升有限。最佳集成策略(两级级联堆叠)仅比最强单模型提升0.18%准确率,但计算成本增加253倍。统计检验表明,三种集成策略与最佳单模型处于同一等价组,而其他三种集成甚至显著更差。逻辑回归元学习器虽然提升了准确率和ROC-AUC,但严重破坏了校准,导致对数损失最差。研究建议实际应用中优先使用贪心选择策略。论文表格基础模型集成学习校准推荐理由:做表格数据建模的团队会发现,盲目集成TFM可能得不偿失——计算成本飙升但收益微乎其微,甚至可能破坏模型校准。建议点开看看,避免踩坑。原文稍后读已读值得跟进有用关注 表格基础模型
14:29官方账号arXiv cs.AI@Aditya Tanna, Nassim Bouarour, Mohamed Bouadi, Vinay Kumar Sankarapu, Pratinav Seth精选表格基础模型在健康数据集上表现优异,但高推理成本和基础设施需求限制了实际应用。研究者提出通过知识蒸馏将预测能力转移至轻量表格模型,并针对上下文表格模型在推理时依赖训练集导致的上下文泄露问题,采用分层折叠教师标注策略。在19个医疗数据集、6个教师模型、4个学生模型家族及多教师集成实验中,蒸馏学生模型保留了教师AUC的至少90%,部分甚至超越教师,同时CPU推理速度提升至少26倍,且保持校准性和公平性。多教师平均并未持续优于最佳单教师。该研究为推理受限的健康场景部署高质量预测提供了可行路径。论文表格基础模型知识蒸馏健康数据推荐理由:医疗AI团队终于有了低成本部署高精度表格模型的方案——蒸馏后模型保留90%性能且快26倍,做健康数据预测的开发者可以直接用。原文稍后读已读值得跟进有用关注 表格基础模型
11:09官方账号arXiv cs.LG@Bart Baesens, Andreas Goethals, Stefan Lessmann, Simon De Vos, Cristián Bravo, David Martens, Victor Medina-Olivares, Christophe Mues, Maria Oskarsdóttir, Seppe vanden Broucke, Tim Verdonck, Wouter Verbeke精选该论文系统评估了表格基础模型(tabular foundation models)在信用风险预测中的表现,涵盖违约概率(PD)和损失率(LGD)两大核心任务。研究发现,这些模型在多个数据集和实验条件下普遍优于梯度提升等传统方法,且在小数据集场景下提升尤为显著。模型无需超参数调优即可直接使用,降低了计算成本和部署门槛。这一发现对中小企业贷款、低违约组合等数据稀缺场景具有重要实践意义。论文信用风险预测表格基础模型小样本学习推荐理由:信用风险建模团队终于有了开箱即用的新选择——表格基础模型在小数据集上表现惊艳,做风控建模的可以直接拿来试试,省去调参烦恼。原文稍后读已读值得跟进有用关注 信用风险预测
19:11官方账号arXiv cs.LG@Marcin Kostrzewa, Sebastian Tomczak, Roman Furman, Anna Poberezhna, Michał Furgała, Oleksii Furman, Maciej Zięba企业破产预测是高风险金融任务,面临严重类别不平衡和多时间跨度预测挑战,但现有公共数据集规模小且稀缺。新基准V4FinBench包含来自维谢格拉德集团四国(2006-2021)的超过100万条公司年度记录,涵盖131个特征、六种预测时间范围,并采用综合财务困境标准。参考评估显示,经过不平衡感知微调的TabPFN在长周期F1和ROC-AUC上达到或超越梯度提升;而Llama-3-8B在每个时间范围的ROC-AUC上均落后于梯度提升。在外部美国破产数据集上,V4FinBench微调的TabPFN优于原始版本,表明学到了可迁移的财务困境结构。该基准已开源,以支持更真实的金融预测方法评估。论文表格基础模型金融预测基准评测推荐理由:对于金融风控从业者,该基准提供了百万级真实财务数据及多时间范围评测框架,可有效检验表格型基础模型和LLM在不平衡场景下的预测能力。原文稍后读已读值得跟进有用关注 表格基础模型