12 RAG 系统的评测怎么做?
2026/9/1...大约 2 分钟
12|RAG 系统的评测怎么做?
开场定框架:RAG 等于检索加生成,评测必须分层做,混在一起评就没办法归因——不知道该修检索还是修生成。
回答思路
第一步:检索层展开
给定问题看标准片段是否被召回:
- 上下文召回率:标准片段有没有被召回
- 精确率:召回的东西有没有用
- 排序质量:MRR、NDCG——标准片段排得靠不靠前,排在第 8 位基本等于没召回
测法:离线构造「问题 + 标准片段」对,把检索单独拉出来打。
第二步:生成层展开
- 核心是忠实度(faithfulness):答案每一句是否被上下文支撑,防无依据发挥——可用 judge 逐句判定或句子级溯源比对
- 其次答案相关性:答没答到点上
- 再加引用正确性:标注的来源是否真支撑那句话
第三步:端到端评整体正确率 + 归因
整体正确率按场景统计,错了做归因,三类归因三条修复路径:
| 归因 | 修复路径 |
|---|---|
| 没召回 | 调切分和索引 |
| 召回了没用上 | 调 prompt 和排序 |
| 生成本身错 | 换模型或加约束 |
这套归因逻辑是本题最值钱的部分。
第四步:工具落地
RAGAS 这类框架 + 自建评测集结合——框架指标是起点不是终点。
收尾
RAG 评测最大的价值不是打分,是归因——告诉团队该修哪里。
考察重点
| 维度 | 说明 |
|---|---|
| 企业动机 | 当下最热的考察点:知识库问答是当前企业落地最多的 LLM 应用,RAG 评测能力是招聘硬通货。能把 RAG 拆开分层评、会做归因的,实战深度立判 |
| 过线标准 | 能分层(检索、生成)+ 说出一侧的具体指标和测法 |
| 区分度 | 会讲归因分析的是实战派;只讲「评答案准不准」的是入门级,等于没分层 |
| 加分项 | 句子级溯源、引用正确性这类细粒度手段,说明评过真实的知识库产品 |
来源
整理自知识星球帖《面试情报 01|大模型测试 20 题》,返回题库。