05 怎么用大模型生成测试用例?怎么保证生成的质量?
2026/9/20...大约 3 分钟
05|怎么用大模型生成测试用例?怎么保证生成的质量?
开场先给完整流程六步——流程完整讲出来,说明你是真跑通过,不是听说过。
回答思路
第一步:完整流程六步
需求预处理(文档切片、补上下文)→ prompt 设计(角色设定加输出格式约束)→ 分模块生成(按功能模块拆开逐个生成,不整篇一次生成)→ 人工评审(核心环节)→ 验证迭代(评审意见回喂优化)→ 入库沉淀。
第二步:质量保障三层防线
| 防线 | 做法 |
|---|---|
| 生成侧 | prompt 内置质量标准(要求覆盖正常、边界、异常,要求给前置条件和预期结果),Few-shot 给两条高质量示例定标杆 |
| 评审侧 | AI 生成的用例默认是草稿,资深测试评审后可用——评审修改率就是质量指标 |
| 校验侧 | 规则检查(用例要素齐全吗、步骤可执行吗)先机筛一轮再人审 |
第三步:讲大模型的强项和弱项分工
- 强项:覆盖面广(会想到你漏掉的边界和异常组合)、格式规范、不知疲倦
- 弱项:业务深度(不知道你们系统的历史坑)、优先级判断、预期结果的业务正确性
扬长避短的用法:「AI 铺面、人攻点,AI 的产出当时刻提醒自己的检查清单」。
第四步:讲和传统方法的结合
AI 生成的测试点用等价类边界值的标准去审它(它有时也会漏边界)——两套体系互查,比单用任何一套都强。
收尾:给一个真实数字
比如评审修改率从初期六成降到三成(prompt 和示例在迭代)、单需求设计工时从四小时降到一个半小时——数字加趋势,说服力全在这。
考察重点
| 维度 | 说明 |
|---|---|
| 企业动机 | 用例生成是 AI 落地测试的第一场景,企业几乎都在做或想做——考察你能不能把它从「演示效果」做成「生产可用」 |
| 过线标准 | 流程完整 + 三层质量防线 |
| 区分度 | 有评审修改率数据、有「AI 铺面人攻点」分工认知的是生产级用户;只会「把需求贴给 ChatGPT」的是玩具级 |
| 加分项 | 用传统用例设计方法反向审计 AI 产出的互查思路 |
| 减分项 | 说「生成的用例直接就能用」——没有质量机制的落地必然出事 |
来源
整理自知识星球帖《面试情报 06|AI 测试提效 20 题》,返回题库。