Toyota 把几十年制造知识接入 AI,但数据不能出内网,靠 Pinecone BYOC 解决。做企业 RAG 的可以看看这种部署模式。
#RAG
做 RAG 检索的可以看看:Weaviate 1.39 的 MMR 参数一个 balance 就能让搜索结果不扎堆,且不用重建索引。
Kaivid Labs 把 40 万向量从 Milvus 搬到 Qdrant 的全过程都写出来了,还带了延迟和内存对比,要做向量库选型的可以看看。
Boltzbit 和剑桥搞了个新架构,把聊天里的新知识直接编译成 LoRA 权重写进模型,长对话和多轮场景下比 RAG 省算力还更准。
有人在 6GB 显存的笔记本上,用土耳其语 109 页报告实测了五款 7B-8B 开源模型,还顺手证明花哨检索方案打不过 TF-IDF,做 RAG 的可以看看。
越南 PDPD 合规催生的实用论文:本地跑 Qwen3.5-27B 配混合 RAG,效果追平云端 DeepSeek-V4-Flash,还公开了越南语 RoPA 基准。
Weaviate 写的 Engram 记忆调优指南,讲了记忆该存什么、怎么检索、放提示词哪里,还教你怎么不弄坏 prompt 缓存,做智能体的可以照着调。
GitHub Podcast 这期专门回应了三个大家争论的点:AI 代码要不要人工审查、RAG 是不是没用、Skills 有没有取代 MCP,想搞清楚这些说法的对错可以听听他们的分析。
做仓库级代码生成的可以看看这篇:FeatLens 用功能索引建图再检索,比全仓库图方法省六成节点、四成多 token,检索还不用调 LLM。
数据集成领域的新论文,LOKI 能自动从文本里发现不同表之间的行级关联,精度 0.982,比直接调 LLM 便宜 40 倍,做数据湖的可以看看。
LlamaIndex 家的 PDF 转 Markdown 工具 LiteParse,一页只要 2.8ms,本地就能跑,做 RAG 解析文档的可以试试。
LlamaIndex 的 Jerry Liu 开源了 DocJev,扔几条自然语言规则就能给文档分类和拆分,速度还比 gpt-5.6-luna 快 6 倍,免费可用。
想用 RAG 做文档问答但怕答案不可信的朋友,可以看看这个方案,它把每个论断都和具体页码、原文片段绑定了,比单纯用模型生成答案更可靠。
微信团队开源的 WeKnora,能帮你把企业里散落在飞书、GitLab 等地方的文档,变成可查询、可推理的专属知识库,还支持安全沙箱和长期记忆。
这个研究很实用,它教我们如何用 ShEx 元数据和 RAG 机制,让 LLM 直接理解知识图谱,而不用再花大力气微调模型,对做知识图谱应用的开发者应该挺有帮助。
Replit 新出的 Routines 功能,能帮你自动安排 AI 代理的工作时间,按小时或天来执行,不用一直开着,还能省下很多令牌。