论文15:24蚂蚁OmniTable系统获VLDB工业最佳论文蚂蚁这套宽表系统能一次性处理35PB语料,效率提升5.6倍,再也不用为洗数据熬夜了。#OmniTable#VLDB#蚂蚁集团#数据清洗量子位@量子位的朋友们原文稍后读已读值得跟进有用关注 OmniTable
论文12:26DataOrchestra:逐示例编排预训练数据处理的框架这篇论文提出了DataOrchestra,能针对每个数据样本定制清洗流程,在多个模型和基准上都有提升,还节省算力。#DataOrchestra#大语言模型#数据清洗#预训练aarXiv cs.AI@Zhen Huang 等 4 人原文稍后读已读值得跟进有用关注 DataOrchestra
论文09:33Desbordante 扩展支持概率函数依赖发现这篇论文在开源数据剖析工具 Desbordante 里加了概率函数依赖发现,对比了传统近似依赖,做数据清洗的话可以看看具体差异。#Desbordante#pFD#函数依赖#数据清洗aarXiv cs.LG@Ilia Barutkin 等 5 人原文稍后读已读值得跟进有用关注 Desbordante
行业09:34AI自动化提取代码与文档数据一个开发者提议搞个AI自动扒代码和文档,专治企业数据清洗最脏最累的活。#数据清洗#代码仓库#文档库#自动化Yangyi@Yangyixxxx原文稍后读已读值得跟进有用关注 数据清洗
论文精选72°11:54斯坦福研究:大模型不怕脏数据,未过滤Common Crawl效果反超这项研究挑战了数据清洗的行业惯例,做大模型训练的团队值得关注——或许可以省下大量清洗成本,直接喂原始数据。#大模型#数据清洗#Common Crawl#斯坦福向阳乔木@vista8原文稍后读已读值得跟进有用关注 大模型