12:26官方账号arXiv cs.AI@Zhen Huang, Yikun Wang, Shijie Xia, Pengfei LiuDataOrchestra提出针对每个数据样本定制处理流程,统一丢弃、保留或清洗操作。清洗时选择程序化编辑或LLM重写,并生成具体指令。在0.5B至7B模型上从零预训练,11个基准平均提升优于单个处理方法。数学持续预训练中超过更强基线,且跳过不必要操作减少计算量。论文DataOrchestra大语言模型数据清洗推荐理由:这篇论文提出了DataOrchestra,能针对每个数据样本定制清洗流程,在多个模型和基准上都有提升,还节省算力。原文稍后读已读值得跟进有用关注 DataOrchestra
09:33官方账号arXiv cs.LG@Ilia Barutkin, Maxim Fofanov, Sergey Belokonny, Vladislav Makeev, George Chernishev该论文研究了概率函数依赖 (pFD) 在数据剖析中的应用,并在开源工具 Desbordante 中实现了 pFD 发现算法。通过对比 pFD 与近似函数依赖 (AFD) 在脏数据场景下的表现,发现 pFD 在某些情况下比 AFD 更有优势。论文还评估了 pFD 发现算法的运行时间和内存消耗,并与 AFD 发现算法进行了比较。实验结果显示 pFD 和 AFD 的输出不能互相替代。论文DesbordantepFD函数依赖推荐理由:这篇论文在开源数据剖析工具 Desbordante 里加了概率函数依赖发现,对比了传统近似依赖,做数据清洗的话可以看看具体差异。原文稍后读已读值得跟进有用关注 Desbordante
09:34Yangyi@Yangyixxxx该帖建议开发一个AI,能自动抓取企业所有系统代码仓库和文档库,并结构化输出数据。作者认为数据整理与清洗是AI数字化落地中最耗时费力的第一步,常被形容为“庞大的吃屎任务”。该想法直指企业数据准备阶段的普遍痛点,缺乏易用工具。行业数据清洗代码仓库文档库推荐理由:一个开发者提议搞个AI自动扒代码和文档,专治企业数据清洗最脏最累的活。原文稍后读已读值得跟进有用关注 数据清洗
11:54向阳乔木@vista8精选72°斯坦福大学研究团队发现,当模型规模足够大时,使用未过滤的Common Crawl数据训练效果反而优于经过清洗的数据。在15M小模型上,过滤数据全面领先;但在330M和1B模型上,未过滤数据在充分训练后超越了所有过滤版本。这表明大模型有足够参数空间将噪声与有用信息分离,颠覆了数据清洗越干净越好的传统认知。论文大模型数据清洗Common Crawl推荐理由:这项研究挑战了数据清洗的行业惯例,做大模型训练的团队值得关注——或许可以省下大量清洗成本,直接喂原始数据。原文稍后读已读值得跟进有用关注 大模型