8月24日
09:53
09:53官方账号arXiv cs.LG@Mieszko Komisarczyk, Saurabh Mathur, Maurice Kraus, Sriraam Natarajan, Kristian Kersting
Tydra,一种混合Transformer-State Space Model架构,在30个OpenML数据集上,相较于TabPFN减少30%的推理时间,同时保持大部分预测性能,优于Hydra模型,表明混合架构是表格基础模型的有前景方向。
推荐理由:Tydra模型在保持预测性能的同时大幅降低推理时间,比Hydra模型更高效。
7月2日
14:00
14:00AI Will@FinanceYF5
73°
Google Research 发布了 TabFM,一个专门针对表格数据的基础模型。该模型支持零样本预测,无需训练、调参或特征工程。TabFM 直接输出预测结果,大幅降低使用门槛。目前该推文获得 388 次查看。
事件专题

推荐理由:如果你厌倦了 XGBoost 调参,TabFM 不用训练直接预测,省时省力,适合表格数据任务。
13:58
13:58AI Will@FinanceYF5
精选
该架构通过交替行列注意力机制同时学习表格中行与列的关系,解决了行列无序问题。采用先压缩每行为向量再进行上下文学习的方式提升计算效率。专门为表格数据重新设计,而非直接套用通用大语言模型。
推荐理由:专门为表格数据设计的架构,用交替行列注意力处理无序,还压缩行向量做上下文学习,比硬套LLM聪明多了。
7月1日
10:40
10:40官方账号arXiv cs.AI@Yuqing Yang, Qi Zhu, Zhen Han, Boran Han, Zhengyuan Shen, Shuai Wang, Vassilis N. Ioannidis, Huzefa Rangwala
这篇论文首次系统评估了大型语言模型在表格任务中的数据引用错误(DRE),覆盖1.7B到20B参数的各种模型。实验发现所有测试模型均存在DRE。通过基于批评模型的过滤和拒绝采样,答案准确率最高提升12.0%。作者训练了一个轻量级4B参数批评模型,在检测分布内和分布外DRE时平均F1达78.2%,并能有效辅助更大模型推理。
推荐理由:论文系统测量了LLM读表格犯数据引用错误的频率,还训练了个4B批评模型能查出这些错,推理准确率提升12%。适合做表格推理的开发者看。
6月4日
11:05
11:05官方账号arXiv cs.LG@Lixing Zhang, Yidong Ouyang, Weifu Li, Shixiang Zhu, Guang Cheng, Liyan Xie
传统缺失值填补方法假设所有缺失都是随机且应被恢复,但现实中缺失可能来自两种不同来源:有意义缺失(数据本身不存在)和观测缺失(应被填补)。研究者提出Diff-Joint,一个基于扩散的框架,联合建模表格数据与潜在缺失掩码,通过条件采样和不确定性感知聚合迭代优化填补值与缺失标签。实验表明,该方法能有效识别有意义缺失,同时保持竞争性填补精度并提升下游任务性能。
推荐理由:处理表格数据的团队终于有了区分“不该填”和“该填”缺失值的工具——Diff-Joint解决了传统填补方法盲目恢复所有缺失的痛点,做数据清洗或医疗、金融等缺失值有语义含义的开发者可以直接试。