先看怎么选
为固定问题保存期望相关文档、实际返回片段和最终答案,先评检索相关性,再评回答是否得到片段支持。评测使用的返回数量应与真实应用一致;增加上下文和引入查询改写,都需要与原流程做对照。
先把问题定位到一段链路 用户只看到最终答案,开发者却需要分开检查入库、检索和回答生成。建议从一个确定有答案的问题开始,同时保存原始问题、返回片段、片段来源以及最终答案。若期望文档从未进入结果,先查检索;若片段已经充分而结论仍错误,再查提示与生成逻辑。 建立可复用的问题与文档对照表 Qdrant 的相关性评估指南使用带标注的查询和期望相关文档组成评测集。来源可以是领域人员标注、真实查询及反馈,或模型生成的合成问题。三者各有局限:人工标注耗时,日志需要足够有效反馈,合成问题可能更贴近原文而让离线结果显得过于理想。 实践中可以先保留一小组经过核对的真实问题,并按问法、主题与难度分组。不要只让常见问题占满样本。每次修改检索设置后,用同一组样本复测,避免把不同问题之间的差异当成改进。 把“相关”具体写成一组可复查的标签 假设自拟资料库有三份文件:A 是当期退货办法,B 是其中一类商品的例外说明,C 是已失效的旧办法。问题是“这类商品现在能否退货”。若答案需要同时读 A 和 B,就把两份都标成相关,并说明各自支持哪一部分;C 即使措辞很像,也不能作为当前规则的有效证据。 假设检索前两项是 C、A,相关文件只找回 A,按这组二元标签,recall@2 为 1/2;第一个相关结果位于第二名,该问题的倒数排名为 1/2。若改进后前两项变为 A、B,recall@2 才变成 1。这个算例只解释指标,不是任何工具的实测成绩。 标签还要与检索单位一致。若返回的是分段而标注的是文档,应先把分段映射到文档并处理重复;同一文件返回三段,不能算成找回三份不同的相关文件。对于需要组合资料的问题,只关注第一个相关结果的位置,也会遗漏“第二份必要证据仍没找到”的问题。 评测数量应接近实际使用方式 如果应用最终只把少量分段交给模型,评测时却允许返回大量结果,离线数字可能掩盖真实体验。Qdrant 文档建议按实际展示或送入模型的数量选择 k;二元相关标签可用于 recall@k 和 MRR,分级相关标签则适合进一步考察 NDCG。指标的选择服务于具体问题,不需要把所有指标都放进同一张看板。 检查入库和查询是否使用相同语义空间 n8n 的 RAG 指南将上传和查询分成不同流程,并要求查询使用与写入时相同的 embedding 模型。它同时说明分段、返回数量和元数据配置会影响检索使用方式。若刚更换了向量模型,应检查现有索引与查询编码是否仍然对应,再考虑调高返回数量。 把检索回退做成可观察的分支 LangGraph 的 agentic RAG 示例展示了一条明确路径:模型判断是否需要检索,取得材料后检查相关性,不相关时改写问题并尝试再次检索,相关时再生成回答。这提供了一种编排方式,但“有重试”本身不等于效果更好。 建议为回退流程记录原查询、改写查询、两次检索结果和退出原因,并在应用中设置可控的尝试边界。若同一问题不断改写却始终没有相关材料,输出信息不足比持续循环更有用。这些退出与日志要求是工程验收建议,需要应用自己实现。 可以再做一次隔离对照:把人工确认足够的片段直接送进原来的回答流程。若仍然答错,优先检查提示、上下文拼装和生成;若这次答对而正常检索时答错,再回到索引、过滤和排序。对照时保留原问题与生成配置,只替换证据输入,避免连模型也一起更换后无法解释差异。 最后再评估用户看到的答案 检索命中正确文档仍不代表答案正确。逐项检查结论是否被片段支持、来源链接是否对应实际引用、问题中的限定条件有没有被忽略。对于资料里没有答案的问题,也要检查系统是否明确说明缺口。 保留两份结果:一份说明检索相关性,一份说明最终回答质量。更换向量模型、调整分段或增加查询改写后,分别观察这两份结果,才能知道投入实际改善了哪一段体验。
放在一起,看清差异
本篇涉及的工具3

Qdrant
官方相关性评估指南提供查询标注、检索输出及指标的核对方法。
- 适合场景
- 已经拥有向量索引,需要用固定样本衡量检索变化的团队。
- 需要留意
- 离线分数受样本与标签质量影响,不直接等于最终回答质量。

n8n
可在可视化流程中分开观察数据入库、向量查询和回答环节。
- 适合场景
- 使用工作流维护知识问答、需要定位节点输入输出的团队。
- 需要留意
- 仍需核对分段策略、embedding 模型一致性及实际返回内容。

LangChain
LangGraph 的官方示例展示检索、相关性判断、改写与生成之间的条件分支。
- 适合场景
- 需要明确控制检索回退与状态变化的开发者。
- 需要留意
- 示例不是效果保证;应用需自行验证退出条件和运行成本。
我们如何筛选
根据文末官方资料核对功能与接口语义,围绕本文问题整理操作路径和验收建议。文中的测试样例属于编辑建议,没有安装实测或性能排名。
参考来源与更新
- Measuring Retrieval Relevance
- Retrieve relevant context | Build | n8n Docs
- Build a custom RAG agent with LangGraph - Docs by LangChain
补充带版本冲突的文档标签、recall 与倒数排名算例、分段去重口径和人工证据隔离对照。
发布于 2026-09-12 · 更新于 2026-09-13


