8月22日
01:13
01:13官方一手AWS Machine Learning Blog@John Cherian
精选
Agentic数据操作平台(ADOP)基于Amazon Bedrock,利用专用AI智能体自动化青铜到白银再到黄金的数据管道生命周期,将新数据源接入时间从数周缩短至数小时,同时保持数据治理和合规控制。
推荐理由:Amazon Bedrock上的Agentic数据操作平台(ADOP)能大幅缩短数据工程时间,自动化数据管道,值得一试。
8月4日
01:42
01:42官方一手AWS Machine Learning Blog@Subhro Bose
Formula 1与AWS合作构建Data Accelerator,基于Amazon Bedrock AgentCore的agentic AI改造其MarTech数据平台。该方案将数据源接入时间从最长8周缩短到约40分钟,并实现schema演进的自动化。F1还获得了覆盖粉丝互动数据资产的全链路可观测性。
推荐理由:F1和AWS搞了个Data Accelerator,用agentic AI把数据接入从几周干到40分钟,还自动处理表结构变化,搞数据的值得看看。
7月16日
13:04
13:04官方账号阿里云 Alibaba Cloud@alibaba_cloud
精选
阿里云推出 EMR Serverless Spark 的混合标量-向量检索功能,可将向量搜索与 SQL 过滤合并为单个查询。该方案支持零数据移动,直接在数据湖中运行,速度比开源 Spark 快 3 倍,并能在数十亿行规模上扩展。适用于离线嵌入、去重等场景。

推荐理由:阿里云把向量搜索和 SQL 过滤合进一条 SQL,不用搬数据,速度还比开源 Spark 快3倍,做大规模离线嵌入和去重非常实用。
5月29日
5月27日
10:30
10:30官方账号arXiv cs.AI@Yi Jing, Zao Dai, Jinwu Hu, Zijun Yao, Lei Hou, Juanzi Li, Xiaozhi Wang
精选
论文提出SAERL框架,利用稀疏自编码器(SAE)提取模型内部信号,用于强化学习(RL)后训练的数据工程。SAERL建模了数据的多样性、难度和质量三个内在属性,分别实现批次多样性控制、易到难课程排序和数据过滤。在Qwen2.5-Math-1.5B上,SAERL相比原始GRPO平均准确率提升3%,训练步数减少20%,且在不同模型规模和RL算法上表现一致。实验表明SAE可跨模型族和规模迁移,是一种轻量可复用的数据工程工具。
推荐理由:做LLM后训练数据工程的团队终于有了从模型内部获取信号的方法——SAERL用SAE直接指导数据排序和过滤,比依赖外部信号更高效,做RL训练优化的开发者值得一试。
5月22日
08:06
08:06Y Combinator@ycombinator
Netter.ai 是一家新创公司,旨在帮助企业重新掌控数据,使团队能够高精度地指导其活动。该公司为缺乏大量数据工程师的企业提供技术能力,解决其最复杂的数据挑战。该产品由 Y Combinator 支持,并已正式发布。
推荐理由:对于数据团队资源有限、却面临复杂数据挑战的企业,Netter.ai 提供了一个无需庞大工程师团队即可实现数据精准管控的解决方案,值得关注。
5月12日
19:11
19:11官方账号arXiv cs.AI@Yaxin Du, Xiyuan Yang, Zhifan Zhou, Wanxu Liu, Zixing Lei, Zimeng Chen, Fenyi Liu, Haotian Wu, Yuzhu Cai, Zexi Liu, Xinyu Zhu, WenHao Wang, Linfeng Zhang, Chen Qian, Siheng Chen
DataMaster 提出了一种自主数据工程框架,旨在通过优化数据侧(包括外部数据发现、选择、清洗和转换)来提升固定学习算法的性能,而无需改变算法本身。该框架集成了树状搜索结构、共享数据池和全局记忆模块,以应对数据工程中开放式的搜索空间、分支依赖优化和延迟验证等挑战。在 MLE-Bench Lite 基准上,DataMaster 将奖牌率提升了32.27%;在 PostTrainBench 上,其在 GPQA 上的表现(31.02%)超过了指导模型(30.35%)。这表明自主数据工程有望成为提升机器学习系统性能的有效手段。
推荐理由:DataMaster 展示了自主数据工程的潜力,特别是在模型架构和训练策略标准化后,数据优化成为关键瓶颈。对于机器学习从业者而言,该框架提供了一种系统化的数据自动化方案,可减少人工试错成本,值得关注其在数据发现与组合方面的实际应用效果。