#数据工程
共 12 条 · 7 天 0 条 · 30 天 0 条
信息流里打上「数据工程」标签的资讯、产品与论文,按刊登时间排,新的在上。
9月1日
8月22日
8月4日
F1用AWS agentic AI将数据接入从8周缩至40分钟
F1和AWS搞了个Data Accelerator,用agentic AI把数据接入从几周干到40分钟,还自动处理表结构变化,搞数据的值得看看。
7月29日
Milvus 3.0 引入 External Collections,无复制搜索湖中向量数据
Milvus 3.0 新出的 External Collections,让你直接搜对象存储里的向量数据,不用再拷贝一份。省掉同步和权限麻烦,快试试。
7月27日
7月16日
阿里云 EMR Serverless Spark 实现单 SQL 混合标量-向量检索
阿里云把向量搜索和 SQL 过滤合进一条 SQL,不用搬数据,速度还比开源 Spark 快3倍,做大规模离线嵌入和去重非常实用。
5月29日
大模型“叫不出人名”背后:低频token退化与FaceMind的SLoW方法
做AI应用或数据工程的团队,这篇把低频token退化讲透了——FaceMind的SLoW方法直接给出了解决方案,值得点开看看怎么从模型规律里建立产品差异。
别给AI拽高级词汇!FaceMind实验证明高频表达更有效
写Prompt总感觉模型不听话?FaceMind的实验戳破了“高级词汇”的幻觉——用高频表达能让模型表现直接起飞,做Prompt工程或微调模型的开发者值得一试。
5月27日
SAERL:用稀疏自编码器内部信号指导LLM后训练数据工程
做LLM后训练数据工程的团队终于有了从模型内部获取信号的方法——SAERL用SAE直接指导数据排序和过滤,比依赖外部信号更高效,做RL训练优化的开发者值得一试。
5月22日
5月13日
5月12日
论文19:11
DataMaster:面向机器学习的自主数据工程框架DataMaster 展示了自主数据工程的潜力,特别是在模型架构和训练策略标准化后,数据优化成为关键瓶颈。对于机器学习从业者而言,该框架提供了一种系统化的数据自动化方案,可减少人工试错成本,值得关注其在数据发现与组合方面的实际应用效果。