#RAG
Citadel Securities 的 COO 分享怎么用 Slack、PPT 和会议记录给公司建一个'自我模型',还讲了踩过的坑,做企业内部 AI 的可以听听。
Long-context 智能体靠摘要记事,写漏一步就全完。这篇论文把摘要器的损失量化拆解,还给出了直接用读者损失训练写入器的 DSSR 方法,做 agent 记忆的值得细看。
一篇讲怎么给金融 Agent 打分的论文:专家定规则,Agent 生成评分标准,还附带 100 个查询的基准,做金融评估的可以看看。
医生朋友做临床数据分析的可以看看这个 CLEAR-Med 框架,让模型先写 SQL 再独立校验,准确率从 12% 拉到 66%,还能弃答不乱猜。
有人把 GPT Researcher 里的 embeddings 换成 Jev,28 个任务测试下来相关内容多了 59%,盲测 15 比 3 获胜,成本没变,仓库开源可以自己试。
AI21 Labs 放出了两场演讲视频,一场讲 RAG 分块该更新打法了,一场用破案的方式带你排查 vLLM 问题,做工程的朋友可以看看。
Criteo、Gorgias 和 Milvus 的人聚在巴黎聊向量检索怎么在生产环境落地,讲召回率和 RAG 索引的实际坑,做检索的可以去听。
Databricks 这份指南教你怎么把 Genie Ontology 越用越准,从数据基础到权限治理一步步搭,建议先挑一个高价值业务域做起。
刷到就收藏然后吃灰的人快看,chubbyskills 把视频播客公众号全转成带来源的 Markdown,还能直接喂给 Agent 用。
搞 Agent 记忆层的可以看看这篇:Jev-Mem 用轻量控制器替代 LLM 做决策,构建快 6.6 倍,LoCoMo 上还涨了 11%。
LlamaIndex 拿美联储 dot plot 当例子,演示表格空单元格怎么让 agent 读错数,LlamaParse 解析后 9 个数字全对上。做文档解析的可以试试。
想面 AI 工程师的同学可以收藏这个开源题库,35 家公司的真题都整理好了,还能看出各公司考察风格的差异。
研究者做了个 3879 条语音声明的核查基准,发现 LALM 听到语音就变笨,加上推理才能到 86.1%,做语音事实核查的可以看看。
LlamaIndex 讲了怎么用置信度分数决定哪些抽取结果直接自动通过、哪些送人工审核,还拿 ExtractBench 数据对比各家表现,做文档抽取的可以看看。
Perplexity 把搜索 API 换成了自家 Rust 写的 Photon 引擎,95% 结果 230 毫秒就回来,做搜索相关应用的可以试试延迟够不够快。
做文档抽取的可以看看,LlamaIndex 用 ExtractBench 实测了置信度过滤怎么用,97% 精确率下 LlamaParse 召回 66.48%,教你算该放多少单自动跑。
Perplexity 新出的 Fast Search API,底层是 Rust 写的 Photon,95% 结果 230ms 内返回,做搜索类应用可以试试延迟表现。
Qdrant 和 DeepLearning.AI 出了门免费短期课,教你做带本地记忆的助手,能离线跑还不传数据,适合动手党。
Milvus 放了个电商搜索 demo,语义召回后直接在库里用 XGBoost 重排,不用再搭一层排序服务,代码也开源了。
桥水的 AI 分析师要在数百万份机密文档上做行级权限,Aaron Linsky 会拆他们的检索层怎么实现,做企业检索的别错过。
Toyota 把几十年制造知识接入 AI,但数据不能出内网,靠 Pinecone BYOC 解决。做企业 RAG 的可以看看这种部署模式。
做 RAG 检索的可以看看:Weaviate 1.39 的 MMR 参数一个 balance 就能让搜索结果不扎堆,且不用重建索引。
Kaivid Labs 把 40 万向量从 Milvus 搬到 Qdrant 的全过程都写出来了,还带了延迟和内存对比,要做向量库选型的可以看看。
Boltzbit 和剑桥搞了个新架构,把聊天里的新知识直接编译成 LoRA 权重写进模型,长对话和多轮场景下比 RAG 省算力还更准。
有人在 6GB 显存的笔记本上,用土耳其语 109 页报告实测了五款 7B-8B 开源模型,还顺手证明花哨检索方案打不过 TF-IDF,做 RAG 的可以看看。