Perplexity 出了开源嵌入模型,小的 0.6B 能跑在边缘设备上,大的 9B 在 MADQA 拿了 92.4%,MIT 协议可以自己部署。
#嵌入模型
Perplexity 把两个嵌入模型开源了,9B 做索引、0.6B 能跑在手机上,PDF 不用 OCR 直接搜,成绩还挺好。
Perplexity 放出了自家的搜索嵌入模型评测,0.6B 小模型就追平了大号 nemotron-embed-8b,做 RAG 检索的可以看看。
Google 开源了个 7.4 亿参数的嵌入模型,一句话就能在手机上搜照片视频和录音,还不用联网,免费商用,做本地搜索的可以去试试。
Google 开源了 EmbeddingGemma 2,一个模型同时嵌入文本、图片、音频和视频,还支持维度裁剪,做 RAG 检索的可以直接试试。
Google 出了 740M 的多模态嵌入模型,文本图片视频都能嵌入,还能配 Gemma 4 离线跑 RAG,权重直接可下。
Fireworks 用不到 10 美元教会你微调 Qwen3-Embedding-8B,三个实验最高 nDCG 涨 36%,做 RAG 的值得看。
Qdrant和FutureAGI要直播修一个RAG agent,现场看每一步改动对效果的影响,还会演示换embedding模型和加rerank。想学RAG调优可以直接围观。
OpenRouter 刚上了 6 个 VoyageAI 的嵌入和重排序模型,文本、多模态、指令跟随都有,32K 上下文,做 RAG 的朋友可以试试。
NVIDIA的Nemotron 3 Embed 8B在LMEB和RTEB两个排行榜都拿了第一,适合做智能体长期记忆的检索。
NVIDIA 开源了三个嵌入模型,8B 的 RTEB 第一,1B 的量化版速度翻倍还能保持 99% 精度,适合做检索和 RAG。
NVIDIA新嵌入模型Nemotron-3-Embed在检索任务上超越Qwen-3-600m,开放权重加NVFP4,适合做记忆系统。
做对话系统评估的团队终于有了一个可复现、低成本的替代方案——无需调用大模型就能衡量对话的语义进展,建议做客服或问答系统的开发者试试这个指标。