大模型测试面试题
2026/8/30...大约 2 分钟
大模型测试面试题
题目整理自知识星球《面试情报 01|大模型测试 20 题》,按面试真实展开顺序分为六组:认知体系 → 评测集 → 指标方法 → 幻觉安全 → 性能稳定 → 工程落地。
用法建议:别背答案。每道题先自己口述一遍,再对照回答思路找缺口。回答思路告诉你怎么开口、分几层展开、带什么例子;考察重点帮你读懂面试官要什么——答到点上比答得多重要。
已收录:认知与体系
| 题号 | 题目 | 一句话考点 |
|---|---|---|
| 01 | 大模型测试和传统功能测试,最本质的区别是什么? | 判「对不对」→ 评「好不好」,断言变度量 |
| 02 | 给你一个新上线的 LLM 知识库问答产品,测试方案怎么设计? | 先反问目标,按数据流分三层,闭环思维(出现率最高) |
| 03 | 大模型的评测维度,你会怎么划分? | 三层框架 + 按业务场景取舍 |
| 04 | 测模型本身和测基于模型的应用,分别测什么? | 边界感:九成岗位在应用层 |
| 05 | 怎么判断一个大模型应用可以上线?门禁怎么定? | 从业务风险反推阈值,分档 + 一票否决 + 灰度兜底 |
待收录(按原帖分组)
| 分组 | 题号 | 状态 |
|---|---|---|
| 评测集建设 | 06-08 评测集从哪建 / 怎么维护 / 数据污染 | 待整理 |
| 指标与评估方法 | 09-12 常用指标 / LLM-as-a-Judge / 人工评估 / RAG 评测 | 待整理 |
| 幻觉与安全 | 13-15 幻觉率 / 安全测试 / 红队 | 待整理 |
| 性能与稳定性 | 16-17 性能测试 / 流式稳定性 | 待整理 |
| 工程化落地 | 18-20 prompt 回归 / CI 集成 / Agent 测试 | 待整理 |
三道必考题提醒:按当前招聘出现频率,02(测试方案设计)、12(RAG 评测)、10(LLM-as-a-Judge)出现率最高,建议优先准备到能白板讲十分钟的程度。
收录标准
- 每题独立一个 Markdown 文件,英文 slug 命名
- 结构固定:一句话定调 → 回答思路(分层展开)→ 考察重点(企业动机 / 过线标准 / 区分度 / 加减分项)
- 欢迎通过 Issue 或 PR 补充你遇到的真实面试题,参见贡献指南