11 AI 应用测试与大模型评测
2026/8/25...大约 8 分钟
11 AI 应用测试与大模型评测
如果你想让测开路线更符合 AI 时代要求,这一块一定要补:评估不确定系统的质量。
为什么重要
AI 应用正在批量进入企业:客服、知识库、报表生成、工单处理。这些系统和传统软件有本质区别——输出不确定、错误是概率性的、质量随模型和 Prompt 版本漂移。传统「输入等于输出」的断言在这里失效。
「会测 AI 应用」的测试工程师,正在成为新的稀缺岗位。而你的传统测试底子(用例设计、回归思维、CI、报告)恰恰是做好 AI 评测的地基——这是测开在 AI 时代最好的差异化机会。
知识清单
四类 AI 应用与测试重点【必须掌握】
| 方向 | 重点测试内容 | 示例 |
|---|---|---|
| LLM API 应用 | 结构化输出、超时重试、限流、降级、成本、审计 | 简历解析、客服问答、文本分类 |
| RAG 应用 | 文档解析、分块、召回、Rerank、答案忠实度、引用溯源 | 企业知识库、制度问答 |
| Agent 应用 | 工具选择、参数生成、执行轨迹、权限边界、失败恢复 | 自动查订单、自动生成报告 |
| 多模态应用 | 图片 / 音频输入、识别准确性、异常文件、安全边界 | 图片审核、票据识别 |
动手搭一个被测对象:Dify 知识库与 Workflow【了解即可,建议动手一次】
评测能力要落在真实对象上。用 Dify(开源 LLM 应用开发平台)花一个周末搭一个知识库问答应用,后面的评测概念就都有了靶子:
- 知识库搭建:文档上传 → 解析 → 分块(chunk 大小 / 重叠)→ 向量化 → 召回配置(TopK、Rerank)。每一个环节都是一个评测点:分块切坏了,召回再准也白搭。
- Workflow 工作流:用可视化节点编排 LLM、知识检索、条件分支、HTTP 请求、变量传递。测试点直接对应:分支覆盖率、节点失败与重试、变量为空、上下游数据契约。
- 迁移认知:Coze、n8n、LangFlow 等平台概念相通,会一个即可举一反三。
- 测开视角:会搭才知道「参数在哪改、失败在哪一层」——出了问题能定位是召回、生成还是编排的锅,这是和纯功能测试拉开差距的地方。
核心评测概念【必须掌握】
先从这些概念入手,每个都要能用自己的话解释:
- Golden Set(评测集):准备一批高质量测试集,覆盖正常问题、边界问题、对抗问题和高风险业务问题。它是 AI 应用的「需求基线」——所有改动都对着它回归。评测集的建设质量直接决定评测的有效性。
- 检索评测(Retrieval):看正确文档有没有被召回,TopK 里位置是否靠前。指标:召回率(Recall@K)、命中排名(MRR、nDCG 的概念级理解)。
- 生成评测(Generation):看回答是否正确、是否忠实于材料(faithfulness,防止一本正经胡说)、是否引用了证据。
- 工具调用评测(Tool Use):看 Agent 有没有选对工具、参数是否准确、失败后有没有恢复。
- 安全评测(Safety):提示词注入、越狱、敏感信息泄露、越权访问。
评测方法【必须掌握】
三种主流方式,各有适用场景:
- 规则断言:关键词包含 / 排除、JSON Schema 校验、正则、长度范围。便宜、快、可进 CI,适合回归兜底。
- 模型评模型(LLM-as-a-Judge):用一个强模型按评分标准(rubric)给回答打分。覆盖面广,但要校准(judge 本身也会偏,需人工抽检 10-20% 对齐)。
- 人工评审:抽样打分,作为前两种的校准基准。高风险场景不可省略。
实践里三者叠加:规则断言守底线、LLM 评委看广度、人工抽检校准。
非确定性输出的断言策略【必须掌握】
这是 AI 测试和传统测试方法论差异最大的地方:
- 断言性质而非字面:不断言回答等于某句话,断言「包含关键事实 X」「不含禁止内容 Y」「格式符合 Schema」「长度在区间内」。
- 多次采样:同一输入跑 N 次,统计通过率(pass@k 思路),而不是单次通过 / 失败。
- 参考答案比对:和标准答案算语义相似度(embedding 余弦相似度阈值)或关键点覆盖度(答案必须包含的要点清单)。
- 容忍度分级:高风险输出(金额、日期、法律条款)严格断言;低风险输出(措辞风格)宽松断言。
评测框架实操【必须掌握(至少上手一个)】
| 框架 | 语言 | 特点 | 适合 |
|---|---|---|---|
| DeepEval | Python | pytest 风格,指标全(忠实度、相关性、幻觉),上手快 | 测开背景首选,和现有技术栈无缝 |
| RAGAS | Python | RAG 专项指标(忠实度、召回质量)最全 | 深耕 RAG 评测 |
| promptfoo | TS/CLI | 配置驱动,Prompt / 模型对比矩阵,CI 友好 | 模型选型、Prompt 迭代对比 |
也可以先自己写一个轻量脚本理解原理:读取评测集 → 批量调用应用接口 → 保存问题、答案、引用、耗时、Token 成本 → 规则断言 + 人工打分表 → 输出对比报告(模型 A vs 模型 B、Prompt v1 vs v2、TopK 3 vs 5)。这本身就是第 12 章的项目四。
质量回归与漂移监控【必须掌握(思路)】
AI 应用上线后质量会「漂移」:模型升级、Prompt 改动、知识库更新、用户问法演化。测开要建立的质量机制:
- 评测集回归:每次 Prompt / 模型 / 检索配置变更,跑一遍 Golden Set,对比分数变化——这就是 AI 应用版的「回归测试」。
- 上线门禁:评测分数低于阈值或相比上一版下降超阈值,阻断发布。
- 线上采样监控:定期抽线上真实问答进评测管线,发现质量滑坡。
- 失败样本回流:bad case 定期归集、标注、进评测集——评测集是活资产,不是一次性交付物。
成本与性能【了解即可】
Token 成本(每次调用的输入 / 输出 token 数)、响应时长 P95、并发吞吐、降级策略(超模型额度时的兜底)。AI 应用的「性能测试」多了成本维度。
学习建议与常见误区
- 先做一个最小的 RAG 评测项目:拿 20 个 QA 对的知识库(比如本仓库的文档),用 LlamaIndex 或 Dify 搭个问答,再写 30 条评测集跑召回和忠实度。一周内可完成,简历上立刻有 AI 测试的实证。
- 评测集从哪来:业务 FAQ、真实客服记录脱敏、文档自动生成的 QA 对(AI 生成 + 人工审)+ 你按第 05 章用例设计思维补的边界和对抗问题。
- 误区一:拿 benchmark 分数当应用质量。 模型榜单分数高不等于你的 RAG 答得好——分块策略、检索配置、Prompt 才是应用层质量的主变量。所以要建自己的评测集。
- 误区二:只测「答得对不对」。 漏测忠实度(答案对但引用了错误材料)、安全性(注入绕过)、性能成本(一次问答 10 秒 3 块钱)都是上线后暴雷点。
- 误区三:LLM 评委当真理。 评委模型自己有偏好(偏长答案、偏自家风格),不校准的 LLM 评委可能引入系统性偏差。保留人工抽检。
- 误区四:一次评测管一年。 评测集不更新,新问法、新业务上线后评测就失真。把「评测集维护」当成和「用例维护」同等级的日常。
自查清单
- 四类 AI 应用(LLM API / RAG / Agent / 多模态)各自的三个测试重点?
- Golden Set 应该覆盖哪四类问题?为什么它是「活资产」?
- 忠实度(faithfulness)和正确性有什么区别?各举一个「对但不忠实」「忠实但不正确」的例子。
- 为什么不能断言 AI 输出等于固定字符串?给出三种替代断言策略。
- pass@k 是什么思路?怎么用到回归里?
- LLM-as-a-Judge 怎么校准?人工抽检比例多少合适?
- Prompt 从 v1 改到 v2,你的上线门禁流程是什么?
- 提示词注入的测试用例怎么设计?(提示:角色伪装、指令覆盖、数据外泄诱导)
- 在 Dify(或类似平台)搭一个知识库问答应用:分块大小和召回 TopK 在哪配置?workflow 里一个条件分支节点你打算怎么测?
推荐资源
- DeepEval 文档:pytest 风格 LLM 评测框架,测开最平滑的入门。
- RAGAS 文档:RAG 评测专项指标。
- promptfoo 文档:Prompt 与模型对比的 CI 化工具。
- LlamaIndex 文档:搭练手 RAG 的最快路径。
- OWASP LLM Top 10:AI 应用安全风险清单,安全用例设计对照表。
- 论文选读:RAGAS、LLM-as-a-Judge(搜标题即得),了解指标设计思想即可,不必抠数学。
- AI 测试开发导航 · 教程专栏:AI 应用评测(RAG / Agent)实战教程。