LlamaIndex 拿 Micron 财报演示文稿测了 LlamaParse,嵌套表格里两个业务单元行名相同,18 个数值照样各归各位,做文档解析的可以试试。
#RAG
Milvus 3.0 的演示,教你检索带图表的 PDF 时别用单向量,用 late interaction 保住细节,适合看论文和报告的人。
9月 AWS 给 AI 开发者发了一波更新,Bedrock 模型选择更多,AgentCore 智能体跑得更快还带评估,写智能体的朋友可以看看
Qdrant 出了 LangGraph 的官方集成包,在 LangGraph 里接 Qdrant 做检索或记忆不用再自己写适配层,直接 pip 装就能用。
Milvus 3.0 把向量库升级成支持全文、JSON 和标量的混合检索引擎,10 月 21 日旧金山现场还有 6sense 的大规模实体解析实战分享。
Pinecone 在旧金山科技周办了场智能体知识分享会,工程 VP 现场演示怎么给智能体规模化灌知识,感兴趣可以白嫖 Nexus 试用
Perplexity 出了开源嵌入模型,小的 0.6B 能跑在边缘设备上,大的 9B 在 MADQA 拿了 92.4%,MIT 协议可以自己部署。
这篇论文把 RAG 从'检索'升级成'主动算证据',RouterLM 用 Qwen3.5-9B 就打赢了 Gemini 3.5 Flash,做 RAG 的可以看看思路。
Unsiloed 这招挺实用:让 AI 从文档读数后写代码算出没印在纸上的数字,还能和原文核对置信度。
Perplexity 开源了两个 late-interaction 嵌入模型,文本图像网页一个空间里查,做 RAG 的可以上手试试。
Perplexity 放出了自家的搜索嵌入模型评测,0.6B 小模型就追平了大号 nemotron-embed-8b,做 RAG 检索的可以看看。
Perplexity 实测 GPT-OSS-120B 做搜索代理,BrowseComp+ 拿了 64.0%,比 ColBERT 高 4.9 分还搜得更少,搞 RAG 的可以看看。
Qlik 讲了他们怎么在 Amazon Bedrock 上给四万多家企业客户做带引用来源的问答系统,多智能体加 Guardrails 的架构细节都在,做企业落地的可以参考。
Google DeepMind 把多模态嵌入模型压缩到手机能跑的体积了,纯文本只占约 191MB 内存,还能搜代码和音视频,做端侧 RAG 的可以看看。
新加坡国立和 collaborators 出的一篇论文,教模型从一堆论文里提炼新研究点子,训练加检索两条路分开验证,做科研 AI 的可以看看思路。
LlamaIndex 的 Logan 写了篇实操文:OCR 别再单次跑,改成布局感知、难元素路由、多轮自检的循环,能救回表格和图表。
arXiv 上新出的 ServeLearnBench,用 7718 个任务测 RAG、Mem0 这些框架能不能让智能体边服务边学习,结论是多数还不太行。
Google 把 EmbeddingGemma 2 用 Apache 2.0 开源了,做 RAG 存几百万条向量的朋友值得看看这篇讲为什么别用闭源 embedding 的分析。
Google 刚发布的 EmbeddingGemma 2 能把文字、图片、音频、视频都转成向量,vLLM 当天就能跑,做 RAG 检索的可以试试 nightly 版。
Google 出了 740M 的多模态嵌入模型,文本图片视频都能嵌入,还能配 Gemma 4 离线跑 RAG,权重直接可下。
Google 出了个只有 740M 参数的嵌入模型 EmbeddingGemma 2,能打过大它两倍的模型,Apache 2.0 开源,做端侧 RAG 搜索很合适。
Weaviate 上线了查询剖析功能,能告诉你慢在 HNSW、过滤还是磁盘读取,示例里 48.2ms 有 36.8ms 花在对象回取,调优前先看这个。
LlamaIndex 的 Logan Markewich 写了篇文档解析新玩法,传统 OCR 一遍过就完事,现在改成循环识别加自检,表格图表都能抠出来,做 RAG 的可以看看。
Milvus 官方把 HNSW 的三种量化方案讲清楚了:SQ8/SQ6、PQ、PRQ 各自怎么压缩、省内存多少、代价是什么,做向量检索选型前很值得看。
微软发了篇论文叫 CorpusMap,提前把文档集合里的实体建好索引页,智能体检索时准确率涨最多 11.7 分,token 还省一半多。
Amazon 这批 COLM 论文一次覆盖智能体、解码控制和代码生成,做 RAG 或 Agent 开发的可以挑感兴趣的翻翻。