7月28日
10:50
10:50官方账号arXiv cs.AI@Yakov Kuzin, Dmitriy Shcheka, Michael Polyntsov, Kirill Stupakov, Mikhail Firsov, George Chernishev
本文研究两种OD发现算法FASTOD和ORDER,并在C++中重新实现以提升性能。在Desbordante开源数据剖析工具中集成后,重新实现版本性能提升最高3倍。结合所提优化技术,性能进一步提升至10倍,内存消耗降低2.9倍。这些改进使顺序依赖发现更贴近工业应用。
推荐理由:这篇论文教你怎么在Desbordante里用C++重写FASTOD和ORDER算法,速度飙到10倍,内存省近3倍,搞数据清洗和查询优化的可以看看。
09:33
09:33官方账号arXiv cs.LG@Ilia Barutkin, Maxim Fofanov, Sergey Belokonny, Vladislav Makeev, George Chernishev
该论文研究了概率函数依赖 (pFD) 在数据剖析中的应用,并在开源工具 Desbordante 中实现了 pFD 发现算法。通过对比 pFD 与近似函数依赖 (AFD) 在脏数据场景下的表现,发现 pFD 在某些情况下比 AFD 更有优势。论文还评估了 pFD 发现算法的运行时间和内存消耗,并与 AFD 发现算法进行了比较。实验结果显示 pFD 和 AFD 的输出不能互相替代。
推荐理由:这篇论文在开源数据剖析工具 Desbordante 里加了概率函数依赖发现,对比了传统近似依赖,做数据清洗的话可以看看具体差异。