AITP
精选全部 AI 动态AI 日报Agent 接入关于更新日志信源提报反馈
登录 / 注册
AITOP
全部 AI 动态
AI 相关资讯全量信息流
全部博客资讯推文论文
全部模型产品行业论文技巧
标签:ML过滤器×
6月16日
20:46
AITOP6月16日 20:46
600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI
6月12日
12:57
AITOP6月12日 12:57
Claude代码里藏了个20260612,18个月后的AI记忆革命已经开始倒计时
6月11日
15:28
AITOP6月11日 15:28
1107 vs 303:谷歌悄悄开源了一个“拆打字机”的模型,把大模型速度翻了4倍
15:23
AITOP6月11日 15:23
DiffusionGemma颠覆文本生成?自回归模型的“统治”要结束了
15:07
AITOP6月11日 15:07
每秒1107个token,Google开源的扩散模型为什么能改变本地推理格局?
6月3日
10:42
10:42arXiv cs.LG@Mihail Stoian, Mark Gerarts, Pascal Ginter, Andreas Zimmerer, Jan Van den Bussche, Andreas Kipf
精选
数据库厂商最近发布了可在过滤谓词中使用的AI函数,但这些函数依赖昂贵且黑盒的ML模型,带来了新的数据管理挑战。传统的数据跳过技术(如针对整数和字符串的)无法适用于这种新过滤器类型,因为没有已知机制能在读取blob存储文件时剪枝不符合条件的行组。本文首次研究ML过滤器的数据跳过技术,证明Parquet默认的min-max元数据足以实现剪枝,并借鉴了ML模型查询语言和神经网络验证两个研究方向。在ReLU架构上的初步实验表明,对于选择性低于0.1%的过滤器,平均剪枝效果达27.4%。此外,受空间连接研究启发,作者提出了一种增强元数据结构——有大小限制的2D凸包,使剪枝效果提升至38.31%,且每行组和列对仅占用最多45字节,在DuckDB中实现了相对于PyTorch的1.07倍端到端加速。
论文数据跳过ML过滤器元数据剪枝Parquet

推荐理由:数据库团队终于有了处理ML过滤器的数据跳过方案——用轻量元数据就能剪枝,做大数据分析或数据库内核开发的建议看看,能直接提升查询性能。
原文
精选全部日报登录