技巧精选

别只看平均Recall@5:按查询类型分解才能发现检索短板

𝗬𝗼𝘂𝗿 𝘁𝗲𝘀𝘁 𝘀𝗲𝘁 𝘀𝗵𝗼𝘄𝘀 𝘀𝘁𝗿𝗼𝗻𝗴 𝗿𝗲𝗰𝗮𝗹𝗹, 𝗯𝘂𝘁 𝗿𝗲𝘁𝗿𝗶𝗲𝘃𝗮𝗹 𝗺𝗮𝘆 ...

精选理由

Milvus教你怎样真正看懂你的召回率——按5种查询类型拆解,别被一个平均数字骗了。

AI 摘要

Milvus指出,仅看平均Recall@5(如85%)会掩盖真实问题。例如,精确术语查询的Recall@5可能只有40%,其他类别拉高了平均值。文章建议将测试用例分为精确术语查询、多跳问题、长尾问题、不可回答问题、权限过滤问题五类,每类至少放5-10个案例分别检查召回率。这样能精准定位检索堆栈中的薄弱环节。

原文 · Milvus

𝗬𝗼𝘂𝗿 𝘁𝗲𝘀𝘁 𝘀𝗲𝘁 𝘀𝗵𝗼𝘄𝘀 𝘀𝘁𝗿𝗼𝗻𝗴 𝗿𝗲𝗰𝗮𝗹𝗹, 𝗯𝘂𝘁 𝗿𝗲𝘁𝗿𝗶𝗲𝘃𝗮𝗹 𝗺𝗮𝘆 ...

𝗬𝗼𝘂𝗿 𝘁𝗲𝘀𝘁 𝘀𝗲𝘁 𝘀𝗵𝗼𝘄𝘀 𝘀𝘁𝗿𝗼𝗻𝗴 𝗿𝗲𝗰𝗮𝗹𝗹, 𝗯𝘂𝘁 𝗿𝗲𝘁𝗿𝗶𝗲𝘃𝗮𝗹 𝗺𝗮𝘆 𝘀𝘁𝗶𝗹𝗹 𝗳𝗮𝗶𝗹 𝗯𝗮𝗱𝗹𝘆 𝗳𝗼𝗿 𝗰𝗲𝗿𝘁𝗮𝗶𝗻 𝗾𝘂𝗲𝗿𝘆 𝘁𝘆𝗽𝗲𝘀. 𝗧𝗵𝗲 𝗽𝗿𝗼𝗯𝗹𝗲𝗺 𝗺𝗶𝗴𝗵𝘁 𝗯𝗲 𝗵𝗼𝘄 𝘆𝗼𝘂 𝗺𝗲𝗮𝘀𝘂𝗿𝗲 𝗿𝗲𝗰𝗮𝗹𝗹, 𝗲𝘀𝗽𝗲𝗰𝗶𝗮𝗹𝗹𝘆 𝗶𝗳 𝘆𝗼𝘂 𝗼𝗻𝗹𝘆 𝗹𝗼𝗼𝗸 𝗮𝘁 𝗮𝘃𝗲𝗿𝗮𝗴𝗲 𝗥𝗲𝗰𝗮𝗹𝗹@𝟱. Say your average Recall @5 is 85%. That looks healthy at first glance. But break it down by query type, and you find exact-term queries are at 40%. The other categories pulled the average up, and you never saw where it failed. 𝗗𝗼 𝗻𝗼𝘁 𝘁𝗿𝗲𝗮𝘁 𝗿𝗲𝗰𝗮𝗹𝗹 𝗮𝘀 𝗼𝗻𝗲 𝗻𝘂𝗺𝗯𝗲𝗿. 𝗦𝗼𝗿𝘁 𝘆𝗼𝘂𝗿 𝘁𝗲𝘀𝘁 𝗰𝗮𝘀𝗲𝘀 𝗯𝘆 𝘁𝘆𝗽𝗲: • Exact-term queries (product models, API names, contract IDs) • Multi-hop questions (answer spread across several documents) • Long-tail questions (rare, but high-risk when they fail) • Unanswerable questions (not in the knowledge base — the system should say so) • Permission-filtered questions (different users see different documents) 𝗣𝘂𝘁 𝗮𝘁 𝗹𝗲𝗮𝘀𝘁 𝟱–𝟭𝟬 𝗰𝗮𝘀𝗲𝘀 𝗶𝗻 𝗲𝗮𝗰𝗵 𝗰𝗮𝘁𝗲𝗴𝗼𝗿𝘆 𝗮𝗻𝗱 𝗰𝗵𝗲𝗰𝗸 𝗿𝗲𝗰𝗮𝗹𝗹 𝘀𝗲𝗽𝗮𝗿𝗮𝘁𝗲𝗹𝘆. 𝗪𝗵𝗲𝗻 𝗼𝗻𝗲 𝘀𝗲𝗴𝗺𝗲𝗻𝘁 𝗹𝗮𝗴𝘀, 𝘆𝗼𝘂 𝗸𝗻𝗼𝘄 𝘄𝗵𝗶𝗰𝗵 𝗽𝗮𝗿𝘁 𝗼𝗳 𝘁𝗵𝗲 𝗿𝗲𝘁𝗿𝗶𝗲𝘃𝗮𝗹 𝘀𝘁𝗮𝗰𝗸 𝘁𝗼 𝗶𝗻𝘀𝗽𝗲𝗰𝘁. 💬 0 🔄 0 ❤️ 0 👀 35 ⚡