20 Agent 类应用(多轮对话 + 工具调用)怎么测试?
2026/9/1...大约 2 分钟
20|Agent 类应用(多轮对话 + 工具调用)怎么测试?
开场按风险组织答案,覆盖面立刻完整。
回答思路
第一步:三类风险
| 风险类型 | 表现 |
|---|---|
| 工具调用风险 | 该调不调、调错工具、参数编造(幻觉填参——编一个不存在的订单号去查)、调用不存在的工具、死循环反复调 |
| 多轮状态风险 | 上下文丢失、指代消解错乱(用户说「它呢」,指代漂移了)、话题切换后旧状态残留 |
| 编排风险 | 分支走错、重试风暴、失败后不降级直接裸奔 |
第二步:测法展开四件套
- 任务级评测集:按用户目标设计完整任务而不是单轮问答,评任务成功率和完成效率
- mock 工具环境:把外部工具挡掉,可控地模拟成功、失败、超时、返回脏数据,验证 Agent 的应对——这是 Agent 测试最关键的基建
- 状态断言:多轮脚本在中途轮次检查记忆和状态是否正确
- 长程任务:几十轮的任务测耐力,看中途会不会遗忘目标
第三步:和单轮评测的本质区别——一句认知亮点
单轮看答案质量,Agent 看目标达成——评测单位从「一次回答」变成「一次任务」。
收尾:讲行业位置
Agent 测试方法论还在早期,标准都在形成中——谁先积累经验谁先值钱。
考察重点
| 维度 | 说明 |
|---|---|
| 企业动机 | 前沿落地能力。企业级 Agent 在 2026 年集中落地,测试方法论严重缺位——这是当前招聘里最稀缺的能力标签。问这题说明团队马上要做 Agent,能讲出 mock 工具环境和长程任务评测的,竞争力直接拉满 |
| 过线标准 | 能列全三类风险 + 讲出 mock 工具环境 |
| 区分度 | 讲得出「评测单位从回答变成任务」「长程耐力测试」的,是对领域有独立思考的;只会复述概念的没有竞争力 |
| 加分项 | 有实际 Agent 测试经验,能现场讲一个具体踩坑故事——这题有故事的人极少,讲一个通过率大幅提升 |
来源
整理自知识星球帖《面试情报 01|大模型测试 20 题》,返回题库。