01:13官方一手AWS Machine Learning Blog@John Cherian精选Agentic数据操作平台(ADOP)基于Amazon Bedrock,利用专用AI智能体自动化青铜到白银再到黄金的数据管道生命周期,将新数据源接入时间从数周缩短至数小时,同时保持数据治理和合规控制。AI产品Agentic数据操作平台Amazon Bedrock数据工程推荐理由:Amazon Bedrock上的Agentic数据操作平台(ADOP)能大幅缩短数据工程时间,自动化数据管道,值得一试。原文稍后读已读值得跟进有用关注 Agentic数据操作平台
01:42官方一手AWS Machine Learning Blog@Subhro BoseFormula 1与AWS合作构建Data Accelerator,基于Amazon Bedrock AgentCore的agentic AI改造其MarTech数据平台。该方案将数据源接入时间从最长8周缩短到约40分钟,并实现schema演进的自动化。F1还获得了覆盖粉丝互动数据资产的全链路可观测性。行业F1AWSAmazon Bedrock推荐理由:F1和AWS搞了个Data Accelerator,用agentic AI把数据接入从几周干到40分钟,还自动处理表结构变化,搞数据的值得看看。原文稍后读已读值得跟进有用关注 F1
00:53Milvus@milvusio精选Milvus 3.0 推出 External Collections 功能,允许用户直接对存储在 S3、Parquet 文件、Lance 数据集或 Iceberg 表等对象存储中的向量数据进行搜索,无需复制到服务数据库。此前有两种方案:复制数据到向量数据库(低延迟但需维护同步)或直接查询湖(无索引全量扫描)。External Collections 提供第三种路径:在源数据上构建向量、BM25 倒排、JSON 和标量索引,数据不移动。该功能为只读零拷贝,支持增量索引新片段,并提供三种加载模型以平衡存储成本与延迟。适用于需要生产级搜索但避免数据复制的湖数据集。AI产品Milvus 3.0External Collections向量数据库推荐理由:Milvus 3.0 新出的 External Collections,让你直接搜对象存储里的向量数据,不用再拷贝一份。省掉同步和权限麻烦,快试试。原文稍后读已读值得跟进有用关注 Milvus 3.0
23:35shao__meng@shao__meng精选Sumanth指出MCP只解决连接层,但跨Jira、Confluence、GitHub等系统的上下文仍是碎片,模型被迫在运行时做数据join。Glean通过MCP Gateway预先构建统一索引和知识图谱,将跨系统信息关联、排序、去重后再返回智能体。在175条企业查询测试中,Glean上下文被偏好比例是现成MCP工具的2.5倍,后者平均多耗30% token。该方案还继承源系统权限、OAuth授权,并做提示注入检查。技巧GleanMCP上下文质量推荐理由:别光调模型了,上下文质量才是瓶颈。Glean把散落十几个系统的信息提前拼好,智能体直接拿整块知识,省token还更准。原文稍后读已读值得跟进有用关注 Glean
13:04官方账号阿里云 Alibaba Cloud@alibaba_cloud精选阿里云推出 EMR Serverless Spark 的混合标量-向量检索功能,可将向量搜索与 SQL 过滤合并为单个查询。该方案支持零数据移动,直接在数据湖中运行,速度比开源 Spark 快 3 倍,并能在数十亿行规模上扩展。适用于离线嵌入、去重等场景。AI产品Alibaba CloudEMR Serverless SparkStarRocks推荐理由:阿里云把向量搜索和 SQL 过滤合进一条 SQL,不用搬数据,速度还比开源 Spark 快3倍,做大规模离线嵌入和去重非常实用。原文稍后读已读值得跟进有用关注 Alibaba Cloud
13:38岚叔@lufzzliz精选本文揭示大模型在生成低频词汇(如冷门人名)时表现不佳,并非小bug,而是底层偏好高频表达所致。作者串联了“马嘉祺”事件、Anthropic tokenizer调整以及FaceMind团队的SLoW和Adam's Law研究,指出频率是大模型数据工程的关键变量。FaceMind早于大众关注低频token退化问题,将其写成论文并落地产品场景。文章还解释了为何prompt并非越多越好,以及高频同义表达更稳定。最后介绍了FaceMind的动态弹幕产品,暗示其可能应用于世界杯等场景。AI模型大模型低频tokenFaceMind10 个信源在谈事件专题推荐理由:做AI应用或数据工程的团队,这篇把低频token退化讲透了——FaceMind的SLoW方法直接给出了解决方案,值得点开看看怎么从模型规律里建立产品差异。原文稍后读已读值得跟进有用关注 大模型
13:08berryxia@berryxia精选FaceMind团队通过100种语言和四大核心任务的实验发现,在语义不变的前提下,使用预训练语料中频率更高的表达方式,无论是Prompting还是Fine-tuning,模型表现都会显著提升。这一发现被称为Adam’s Law(文本频率定律),它补充了数据工程中“质量-规模-难度”铁三角缺失的第四维度:频率。高频表达不是简化,而是让模型在熟悉的概率空间里工作,效果更好。写Prompt时,应优先考虑模型在训练语料中见过的频率,而非追求文雅或专业。技巧Prompt工程文本频率定律FaceMind1 个信源在谈事件专题推荐理由:写Prompt总感觉模型不听话?FaceMind的实验戳破了“高级词汇”的幻觉——用高频表达能让模型表现直接起飞,做Prompt工程或微调模型的开发者值得一试。原文稍后读已读值得跟进有用关注 Prompt工程
10:30官方账号arXiv cs.AI@Yi Jing, Zao Dai, Jinwu Hu, Zijun Yao, Lei Hou, Juanzi Li, Xiaozhi Wang精选论文提出SAERL框架,利用稀疏自编码器(SAE)提取模型内部信号,用于强化学习(RL)后训练的数据工程。SAERL建模了数据的多样性、难度和质量三个内在属性,分别实现批次多样性控制、易到难课程排序和数据过滤。在Qwen2.5-Math-1.5B上,SAERL相比原始GRPO平均准确率提升3%,训练步数减少20%,且在不同模型规模和RL算法上表现一致。实验表明SAE可跨模型族和规模迁移,是一种轻量可复用的数据工程工具。论文稀疏自编码器数据工程强化学习推荐理由:做LLM后训练数据工程的团队终于有了从模型内部获取信号的方法——SAERL用SAE直接指导数据排序和过滤,比依赖外部信号更高效,做RL训练优化的开发者值得一试。原文稍后读已读值得跟进有用关注 稀疏自编码器
08:06Y Combinator@ycombinatorNetter.ai 是一家新创公司,旨在帮助企业重新掌控数据,使团队能够高精度地指导其活动。该公司为缺乏大量数据工程师的企业提供技术能力,解决其最复杂的数据挑战。该产品由 Y Combinator 支持,并已正式发布。AI产品数据管理企业工具Y Combinator推荐理由:对于数据团队资源有限、却面临复杂数据挑战的企业,Netter.ai 提供了一个无需庞大工程师团队即可实现数据精准管控的解决方案,值得关注。原文稍后读已读值得跟进有用关注 数据管理
00:33官方一手Meta Engineering Blog(博客/媒体)70°Meta对其数据摄入系统进行了重大改造,从旧架构迁移到全新系统,以确保社交图谱快照的可靠性。迁移过程涉及整个数据基础设施的重新部署,Meta分享了其解决方案和策略,包括分阶段迁移、兼容性设计和自动化工具。这一变革旨在提升大规模数据处理的可扩展性和稳定性,为Meta的工程团队提供更实时的数据支持。对于依赖海量数据的企业,该案例展示了如何平滑过渡关键基础设施。行业数据工程基础设施迁移可靠性推荐理由:该文提供了Meta在超大规模数据系统迁移中的具体经验,对面临类似基础设施升级挑战的工程团队具有直接参考价值。原文稍后读已读值得跟进有用关注 数据工程
19:11官方账号arXiv cs.AI@Yaxin Du, Xiyuan Yang, Zhifan Zhou, Wanxu Liu, Zixing Lei, Zimeng Chen, Fenyi Liu, Haotian Wu, Yuzhu Cai, Zexi Liu, Xinyu Zhu, WenHao Wang, Linfeng Zhang, Chen Qian, Siheng ChenDataMaster 提出了一种自主数据工程框架,旨在通过优化数据侧(包括外部数据发现、选择、清洗和转换)来提升固定学习算法的性能,而无需改变算法本身。该框架集成了树状搜索结构、共享数据池和全局记忆模块,以应对数据工程中开放式的搜索空间、分支依赖优化和延迟验证等挑战。在 MLE-Bench Lite 基准上,DataMaster 将奖牌率提升了32.27%;在 PostTrainBench 上,其在 GPQA 上的表现(31.02%)超过了指导模型(30.35%)。这表明自主数据工程有望成为提升机器学习系统性能的有效手段。论文数据工程自主智能体机器学习推荐理由:DataMaster 展示了自主数据工程的潜力,特别是在模型架构和训练策略标准化后,数据优化成为关键瓶颈。对于机器学习从业者而言,该框架提供了一种系统化的数据自动化方案,可减少人工试错成本,值得关注其在数据发现与组合方面的实际应用效果。原文稍后读已读值得跟进有用关注 数据工程