04 测模型本身和测基于模型的应用,分别测什么?
2026/8/30...大约 2 分钟
04|测模型本身和测基于模型的应用,分别测什么?
开场先给边界判断:模型是采购或开源的,应用是自建的。测试团队的职责主要在应用层,但模型层不是完全不管——选型时要评,厂商升级时要回归。
回答思路
边界判断
模型层做抽检和选型对比,不做全量模型评测——那是厂商和评测机构的活。
模型层:测什么
- 基准能力评测:通用基准 + 自建业务基准
- 鲁棒性:同义改写、格式变化的稳定性
- 安全基线抽检
应用层:测什么(重点,占答案三分之二)
- prompt 模板测试
- RAG 链路(检索、生成)
- 工具和函数调用的正确性
- 业务流程编排
- 异常处理
并点明:应用层大量内容可以确定性测试,传统方法照样适用。
收尾:讲一个两层交界的典型场景
模型厂商发了新版本,应用要不要跟?拿评测集对新旧版本做回归对比,看核心指标和成本的差异,再决策。
这个场景能讲出来,说明真在这两层之间干过活。
考察重点
| 维度 | 说明 |
|---|---|
| 企业动机 | 边界感——怕招到认知错位的人,以为进来搞模型研究,入职发现是应用测试。知道自己在产业链里该测什么,这题是双方的对齐题。目前市面上大部分岗位九成是应用层评测 |
| 过线标准 | 分清两层边界,说清自己该干什么、不该干什么 |
| 区分度 | 能讲「模型版本升级回归」这种交界场景的,是实际干过的 |
| 减分项 | 不夸口「测模型」,大谈微调、训练、对齐技术细节——岗位错位信号,面试官会担心你不甘心做测试 |
来源
整理自知识星球帖《面试情报 01|大模型测试 20 题》,返回题库。