02:03Milvus@milvusio精选当AI Agent给出糟糕回答时,问题往往不在模型而在检索层。向量搜索结果受嵌入、索引类型、量化、元数据过滤等因素影响。IVF、HNSW、DiskANN各有不同权衡,量化提升速度与存储但需检查召回率。Simon Hearne的演讲演示了如何可视化向量搜索,类似SQL的EXPLAIN。调试时建议直接追踪recall@k、观察分数分布、监控过滤命中率。技巧Milvus向量检索RAG推荐理由:Milvus 团队分享:Agent 答错先查检索层,用 EXPLAIN 思路可视化向量搜索,讲 IVF/HNSW/DiskANN 取舍,搞 RAG 的值得看。原文稍后读已读值得跟进有用关注 Milvus
19:53Qdrant@qdrant_engine当用户反复询问退款政策这类同一问题时,每次请求都会触发一次完整的API往返。Qdrant指出,关键词缓存只能处理精确匹配,换一种问法就失效。语义缓存会把已问过的问题和对应答案存起来,新查询先做语义相似度匹配。相似度超过阈值就直接返回缓存答案,不再走检索和生成流程。详细做法可参考qdrant.tech上的指南。技巧Qdrant语义缓存向量检索推荐理由:Qdrant这篇讲怎么用语义缓存省API调用,相似问题直接回旧答案,不用每次检索生成,适合做聊天机器人的参考。原文稍后读已读值得跟进有用关注 Qdrant
09:46官方账号arXiv cs.LG@Hakan Ferhatosmanoglu, Kushal Kumar, Tal Wagner, Andy WarfieldQASP 通过一次监督回归预测每条查询的完整召回曲线,省去搜索中的迭代模型调用。它使用缩放不变特征和搜索前推理,可跨召回目标、索引配置和数据集泛化。实验显示,QASP 达到 99% 召回率时数据访问减少 80%,并显著降低召回方差和偏差。论文还证明其训练样本量不随数据规模增长,数据访问节省随内在维度指数增长。论文QASP向量检索搜索策略推荐理由:向量搜索老是调参?QASP 一次预测整条召回曲线,不用反复试,还省 80% 数据访问。做检索的朋友可以看看。原文稍后读已读值得跟进有用关注 QASP
02:34Qdrant@qdrant_engine精选Qdrant Edge 在 Vector Space Day SF 上演示了完整的本地检索管线,无需网络跳转。相比云端52ms的延迟,本地运行仅需0.1ms。该方案面向机器人、无人机、可穿戴设备等边缘场景,使用与云端相同的 API 和引擎。Dylan Couzon 展示了这一对比结果,完整演讲视频已上线。AI产品Qdrant EdgeQdrant边缘计算推荐理由:Qdrant Edge 把检索延迟从52ms降到0.1ms,适合机器人无人机等边缘设备,不用再等云端响应了。原文稍后读已读值得跟进有用关注 Qdrant Edge
19:21Qdrant@qdrant_engineQdrant将于7月23日在慕尼黑TNG Technology Consulting举办BASED Meetup #6,采用BarCamp和OpenSpace混合形式,无预设议程,话题由参与者现场提出。活动聚焦搜索、检索、RAG、Agentic RAG与记忆、生产级检索优化、现代搜索质量指标、多模态与跨语言搜索等。Qdrant DevRel团队成员krotenWanderung将共同主持,与会者可与其直接交流向量搜索相关问题。活动时间为18:00-21:00(GMT+2),需提前注册。行业QdrantBASED Meetup向量检索推荐理由:在慕尼黑的话,去Qdrant的BASED Meetup #6吧,自由讨论向量搜索和RAG,直接和团队聊,不用听枯燥汇报。原文稍后读已读值得跟进有用关注 Qdrant
11:36官方一手arXiv: OpenAI@Navnit Shukla, Kamal Pandey, Omsankar Tiwari精选TurboVec基于TurboQuant的4-bit标量量化,在DBpedia OpenAI嵌入基准(d=1536, 100K-999K向量)上,Recall@5比同内存的FAISS PQ高8.5-8.9个百分点。对比HNSW(R@5=0.991)和IVF-PQ(R@5=0.840),TurboQuant无需训练即达更高召回。在Snowpark Container Services上,100K向量中位数延迟11ms,而暴力扫描为707ms。内核级过滤在10-1000租户下Recall@10为0.86-0.93,远高于后过滤的0.09-0.19。量化设计使成员推断准确率降至随机水平(50.0%),而PQ为57.3%。论文TurboVecTurboQuantRAG推荐理由:TurboVec用一种新量化方法让企业RAG检索又快又安全,召回比FAISS PQ高近9个点,还能防隐私泄露。原文稍后读已读值得跟进有用关注 TurboVec
19:17量子位@鹭羽OceanBase推出湖库一体架构,实现一套技术栈同时支持离线湖仓和在线事务处理。该架构在TPC-H 100TB基准测试中获得599万QphH成绩,刷新世界纪录。此外,OceanBase 4.3版本引入向量检索能力,支持AI应用场景。通过统一存储与计算引擎,用户无需数据迁移即可完成数据分析和实时业务。AI产品OceanBase湖库一体AI数据库推荐理由:OceanBase搞了个湖库一体架构,一套技术栈搞定离线和在线,还拿了TPC-H冠军,做AI数据库的可以看看。原文稍后读已读值得跟进有用关注 OceanBase
01:10Milvus@milvusio精选Milvus 尝试跳过压缩步骤,直接在文档完整 embedding list 上建立 HNSW 图索引。该方法在 TREC-COVID 上 nDCG@10 达 0.98,远超 MUVERA、LEMUR 等方法的 0.87-0.89。端到端检索中 TREC-COVID 分数 0.516 与 BruteForce 完全持平,MS MARCO 上 0.957 接近精确上限的 0.966。但构建成本显著增大:MS MARCO 平均长度 87 时耗时 6 倍,TREC-COVID 长度 236 时达 18 倍。对于 ColQwen2 等每文档含 5143 个 patches 的长向量,该方法成本过高无法实用。实验揭示当前近似策略的质量损失主要源自向量压缩步骤而非 HNSW 索引本身。AI模型HNSWMilvus嵌入列表索引推荐理由:Milvus 把 embedding 列表直接塞进 HNSW,质量几乎追上暴力搜索,比 MUVERA 高了一截,但成本也翻了 6-18 倍,长文档还不支持。适合对精度有极致需求的项目。原文稍后读已读值得跟进有用关注 HNSW
23:56Milvus@milvusioLEMUR 是一种将多向量压缩为单向量的策略,声称无需调参、数据驱动。但研究发现,在文档长度差异大的语料(如 LoTTE,长度范围 400 倍)上,LEMUR 会学习到“长文档得分更高”的偏差,导致按长度而非相关性排序。在 LoTTE 上,LEMUR 的 nDCG@10 仅 0.109,召回率 30.5%,而 Exact MaxSim 方法达 0.722 和 98%。问题根源在于 LEMUR 的训练标签(MaxSim 分数)天然偏向长文档,MLP 学到了长度信号。建议用户检查语料的长度分布(P90/P10 比)和模型的可分离性(MaxSim 标准差),若长度差异大或可分离性高,应改用 TokenANN 或 MUVERA。已使用 LEMUR 的团队可通过长度分层采样缓解偏差。论文向量检索多向量压缩长度偏差推荐理由:做向量检索的团队注意了——LEMUR 在长尾语料上会悄悄按文档长度排序而非相关性,LoTTE 上召回率从 98% 掉到 30.5%。如果你的语料长度差异大(P90/P10 > 20),建议先跑文中的两个检查再决定是否用 LEMUR。原文稍后读已读值得跟进有用关注 向量检索
00:49Qdrant@qdrant_engineQdrant 在 Vector Space Day 上联合 Adobe 展示了一种结合向量搜索与图治理层的企业级检索架构。该方案通过 Qdrant 实现快速向量检索,同时利用 Neo4j 的图数据库确保检索结果符合用户身份、权限和策略。现场演示显示,同一查询会根据不同用户的治理规则返回不同结果,而不仅仅是基于相关性排序。这一架构解决了企业 AI 中检索速度与安全合规之间的核心矛盾。AI产品向量检索图数据库权限治理推荐理由:企业 AI 团队终于有了兼顾速度与权限的检索方案——Qdrant + Neo4j 的架构直接解决了「谁可以看什么」的治理难题,做企业级 RAG 或智能体系统的开发者值得关注。原文稍后读已读值得跟进有用关注 向量检索
22:21Qdrant@qdrant_engineQdrant 举办的 Vector Space Day 活动邀请到 Neo4j 开发者关系副总裁 Stephen Chin,他将分享上下文图如何赋予智能体关系理解能力,使其不仅能检索,还能真正推理。活动将于 6 月 11 日在旧金山 The Midway 举行,聚焦智能体与内存的生产级应用、从云到边缘的检索以及多模态 AI。已有 300 多位 AI 构建者报名参加。行业智能体向量检索知识图谱1 个信源在谈事件专题推荐理由:做智能体或 RAG 系统的开发者,如果发现向量检索经常答非所问,这场演讲会点出关键缺失——关系理解。建议关注活动内容或后续回放。原文稍后读已读值得跟进有用关注 智能体