7月28日
12:26
12:26官方账号arXiv cs.AI@Zhen Huang, Yikun Wang, Shijie Xia, Pengfei Liu
DataOrchestra提出针对每个数据样本定制处理流程,统一丢弃、保留或清洗操作。清洗时选择程序化编辑或LLM重写,并生成具体指令。在0.5B至7B模型上从零预训练,11个基准平均提升优于单个处理方法。数学持续预训练中超过更强基线,且跳过不必要操作减少计算量。
推荐理由:这篇论文提出了DataOrchestra,能针对每个数据样本定制清洗流程,在多个模型和基准上都有提升,还节省算力。
09:33
09:33官方账号arXiv cs.LG@Ilia Barutkin, Maxim Fofanov, Sergey Belokonny, Vladislav Makeev, George Chernishev
该论文研究了概率函数依赖 (pFD) 在数据剖析中的应用,并在开源工具 Desbordante 中实现了 pFD 发现算法。通过对比 pFD 与近似函数依赖 (AFD) 在脏数据场景下的表现,发现 pFD 在某些情况下比 AFD 更有优势。论文还评估了 pFD 发现算法的运行时间和内存消耗,并与 AFD 发现算法进行了比较。实验结果显示 pFD 和 AFD 的输出不能互相替代。
推荐理由:这篇论文在开源数据剖析工具 Desbordante 里加了概率函数依赖发现,对比了传统近似依赖,做数据清洗的话可以看看具体差异。