13 什么是大模型幻觉?幻觉率怎么测?
2026/9/1...大约 2 分钟
13|什么是大模型幻觉?幻觉率怎么测?
先讲定义理解和分类:幻觉是输出内容不忠实于事实或给定依据——先分类再谈测,面试官就知道你不是背新闻的。
回答思路
第一步:分类
- 内在幻觉:与给定上下文直接矛盾——RAG 场景里最致命(检索说 A 它答 B)
- 外在幻觉:上下文没有、它自己发挥补充的
第二步:测法按场景展开三种
| 场景 | 测法 | 度量 |
|---|---|---|
| 封闭问答(有标准答案) | 事实校验核对,逐句判真伪 | 幻觉率 = 含错误事实的回答占比 |
| RAG 场景 | 测忠实度:判断答案每句是否被检索内容支撑——规则可判的用规则,语义性的用 judge | 忠实度 |
| 知识边界探测 | 故意问模型知识截止日期之后或超出范围的问题 | 看它是编造还是拒答——不该知道的要拒答 |
第三步:讲度量输出,别只给一个总数
- 按场景分布
- 按严重级别分:无害的细节偏差和致命的事实错误不是一个量级
- 高风险场景单列红线,单独汇报
第四步:顺带讲缓解(面试官大概率追问)
引用溯源强制标注来源、拒答机制、RAG 接地、后置事实校验——说明你知道测试结论怎么反哺改进。
考察重点
| 维度 | 说明 |
|---|---|
| 企业动机 | 幻觉是企业上 AI 产品最大的顾虑,尤其面向客户的场景,一次事实错误可能就是舆情。企业要的是能把「幻觉」从形容词变成可度量风险指标的人 |
| 过线标准 | 定义清楚 + 至少一种可落地的测法 |
| 区分度 | 能把幻觉从「现象」讲到「分级指标」的候选人不多;能把拒答当镜像指标来讲的更少——这两步都是明显加分 |
| 减分项 | 只会说「模型会一本正经胡说八道」这种描述性表达,落不到度量上 |
来源
整理自知识星球帖《面试情报 01|大模型测试 20 题》,返回题库。