06 评测集怎么建?数据从哪来?
2026/9/1...大约 3 分钟
06|评测集怎么建?数据从哪来?
评测集是大模型测试的第一生产力。开场按来源展开,每类带一句适用阶段,再落到字段结构、覆盖设计、规模策略——四层讲完,动手能力就立住了。
回答思路
第一步:按来源展开,每类带适用阶段
| 来源 | 特点 | 适用阶段 |
|---|---|---|
| 业务真实日志 | 最贴近真实分布 | 冷启动之后逐步积累替换 |
| 专家构造 | 冷启动主力,按场景框架系统生成 | 从零搭建期 |
| 历史 bad case | 最有价值的部分,直接对齐线上弱点 | 上线后持续补充 |
| 公开基准裁剪 | 补充覆盖面,但要本地化改写防止水土不服 | 补缺口 |
| 模型辅助生成 | 效率高,但必须人工审核,防止「模型评模型」的偏置 | 扩量提效 |
第二步:讲字段结构——体现专业度的硬细节
每条 = 输入 + 期望输出(参考答案或判定标准)+ 场景标签 + 优先级。
重点讲「判定标准」字段:很多场景没有唯一正确答案,但必须写清什么样的输出算合格——这个字段是评测能自动化的前提。
第三步:讲覆盖设计
- 高频主流程
- 边界:超长输入、跨领域问题、格式混乱
- 对抗样本:诱导、注入、试图越权的提问
- 应拒答场景:知识边界外的问题,测它会不会老实说不知道
第四步:讲规模策略
50 到 100 条冷启动,先把评测流程跑通,靠 bad case 回流滚动长大,不追求一步到位。
收尾:现场举一条具体样例展示字段
「输入:问某 2023 年之前的政策;判定标准:必须依据检索内容回答并给出来源,检索不到应拒答;标签:RAG-合规;优先级:P0」
考察重点
| 维度 | 说明 |
|---|---|
| 企业动机 | 动手能力。没有评测集一切评测都是空谈,企业要能从零搭起来的人,说不出数据来源和字段结构的,基本没做过 |
| 过线标准 | 说得出至少三类数据来源,能描述评测集的字段结构 |
| 区分度 | 做过的人会主动讲「判定标准字段」和「bad case 回流」;没做过的人只会说「收集一些问题和答案对」 |
| 加分项 | 讲模型辅助生成要人工审核、公开基准要本地化——这两句都是踩过坑的人才会说的话 |
来源
整理自知识星球帖《面试情报 01|大模型测试 20 题》,返回题库。