09 CI 里挂了一堆失败用例,用 AI 做失败分析和归类怎么落地?
2026/9/20...大约 2 分钟
09|CI 里挂了一堆失败用例,用 AI 做失败分析和归类怎么落地?
开场先讲痛点的量级:CI 每天几十条失败,人工看日志每条几分钟——这是测试团队最碎最耗时的活,也是 AI 落地回报最快的场景之一。
回答思路
第一步:落地的流程设计(闭环)
失败触发 → AI 分析 → 结果路由- 失败触发:CI 失败后自动收集上下文——日志、报错堆栈、截图、变更记录、失败历史
- AI 分析:把结构化上下文喂给模型,按预设分类体系归因——环境问题 / 代码变更引入 / 用例自身 flaky / 数据问题 / 待定
- 结果路由:环境问题自动告警或重试、代码问题挂到对应开发的变更、flaky 进治理清单、待定的人工看
全流程自动化 + 人工兜底。
第二步:讲分类体系的设计要点
- 类别要贴合自己团队:先统计历史失败的人工归因分布,按实际分布定类别——不要抄理论分类
- 每类配处置动作:归类的目的是路由,不是打标签
第三步:讲准确率的保障
- 历史失败和人工归因结果攒成评测集(几千条后准确率可以量化)
- 置信度分档:高置信自动处置、低置信人工复核
- 定期抽检:自动归因的结果抽 10% 人工验证,漂移了就修 prompt 或补样本
机器学习的运营纪律用在 LLM 上。
收尾:给数字
比如每天失败的初筛时间从一小时降到十分钟、自动归因准确率到八成后人工只看剩下的两成——效率故事用数字收口。
考察重点
| 维度 | 说明 |
|---|---|
| 企业动机 | 失败分析是 AI 落地测试的明星场景(各厂都在做智能 CI 分析)——面试官自己团队大概率在做或想做,这题答得好是即战力证明 |
| 过线标准 | 流程闭环(收集到路由)+ 分类体系从历史数据来 |
| 区分度 | 讲评测集量化准确率、置信度分档路由的是真运营过的 |
| 加分项 | 归因结果反哺(哪类失败高发推动源头治理)的闭环意识 |
| 减分项 | 只说「把日志发给 ChatGPT 看看」,没有流程设计和运营机制 |
来源
整理自知识星球帖《面试情报 06|AI 测试提效 20 题》,返回题库。