09 大模型评测常用指标有哪些?各适用什么场景?
2026/9/1...大约 2 分钟
09|大模型评测常用指标有哪些?各适用什么场景?
开场定调:按任务类型组织答案,不要报菜名。三条线各报两三个,结构就立住了。
回答思路
第一步:按任务类型组织指标
| 任务类型 | 典型场景 | 指标 |
|---|---|---|
| 分类任务 | 意图识别、内容审核 | 准确率、精确率、召回率、F1 |
| 生成任务 | 问答、摘要、创作 | ROUGE、BERTScore 等参考对比指标 |
| 检索任务 | RAG 召回环节 | 召回率、MRR、NDCG |
第二步:每类指标配一个「取舍故事」
这是真正拉开差距的部分:
- 有害内容检测召回优先——漏放一条的代价远大于误杀十条
- 意图识别类别不平衡时准确率会骗人,要看每类的精确率召回率
第三步:主动讲参考对比指标的局限
ROUGE 这类字面重叠指标,同义改写就失灵——字面不像但语义对会判错,所以生产上常用人工多维评分或 judge 模型补位。能自己指出指标的失效场景,比多背五个指标值钱。
收尾:讲选型逻辑
指标服务于质量目标——先和业务方定义什么叫「好」,再选度量,反过来就是凑数。
考察重点
| 维度 | 说明 |
|---|---|
| 企业动机 | 报菜名和真理解的差距,能讲出 ROUGE 与语义等价偏差的才是真懂。指标体系是评测落地的通用语言,企业要能同时和算法团队、业务方对话的人 |
| 过线标准 | 按任务类型组织指标,说出两三个指标的具体适用和局限 |
| 区分度 | 会讲「指标局限」和「按场景取舍」的是真用过;背名词清单的,追问一层就塌 |
| 加分项 | 精确率和召回率的业务取舍故事讲得具体,说明真在生产环境做过决策 |
来源
整理自知识星球帖《面试情报 01|大模型测试 20 题》,返回题库。