01 大模型测试和传统功能测试,最本质的区别是什么?
2026/8/30...大约 2 分钟
01|大模型测试和传统功能测试,最本质的区别是什么?
一句话定调:传统测试是在判「对不对」,大模型测试是在评「好不好」。传统测试验证确定性,拿输出对标准答案;大模型测试度量概率性,没有唯一标准答案,围绕给输出打分。
回答思路
开场:先亮观点再展开
结论先给面试官,他才有兴趣听你往下讲——传统测试是验证确定性,大模型测试是度量概率性。
第一层:输出非确定性
同样输入存在多种正确答案,断言从「相等」变成「合格判定」。常见的断言形态有三类:
- 规则判定:格式、包含关系
- 评分模型:judge 打分
- 人工评审
此时可以举个例子:「问推荐三家餐厅,两次回答内容不同——传统视角是 bug,大模型视角是正常,只要都满足有用、无害、相关」。
第二层:正确性标准变了
正确性没有唯一标准,评估从确定性校验变成多维度度量:
- 传统功能对错由需求文档定义
- 大模型的「好」是多维的:准确、相关、安全、一致、风格
- 测试的第一件事是把「好」翻译成可度量的指标——这步需求文档帮不了你
第三层:测试对象分层
模型本身和基于模型的应用要分开测:
- 模型是黑盒不可控,只能评测和选择
- 应用层(prompt 模板、RAG 链路、工具调用、流程编排)依然大量可以确定性测试,传统方法照样适用
收尾:拔高一层
测试策略从「写用例验证」转向「建评测集度量」——这不是测试被 AI 干掉,是产品质量保障的玩法变了。
考察重点
| 维度 | 说明 |
|---|---|
| 企业动机 | 团队正在或即将接大模型项目,要判断你的传统测试经验能不能迁移;只会把传统方法硬套的人,讲不出「确定性到概率性」这个变化 |
| 过线标准 | 能说出「非确定性输出、断言变度量」,并能解释为什么 |
| 区分度 | 初级回答停在「输出不固定」的现象层;资深会讲分层(模型 vs 应用)、会举具体例子、会讲测试策略随之怎么变 |
| 减分项 | 说「大模型没法测只能靠人看」暴露没有方法论;说「和传统一样写用例」暴露没理解差异 |
来源
整理自知识星球帖《面试情报 01|大模型测试 20 题》,返回题库。