03 大模型的评测维度,你会怎么划分?
2026/8/30...大约 2 分钟
03|大模型的评测维度,你会怎么划分?
答法核心:先给自己的分层框架再展开,不要直接报清单。维度清单本身不值钱,按场景挑维度才是本题真正的得分点。
回答思路
第一步:给出三层分类框架
| 层 | 覆盖维度 |
|---|---|
| 能力层 | 理解、生成、推理、知识、代码、多语言 |
| 质量层 | 准确性、相关性、一致性、幻觉率、安全性、鲁棒性 |
| 工程层 | 时延、吞吐、成本 |
用分层体系化展开,这样讲起来才有底气。
第二步:每层点一两个代表指标
稍微展开半句即可。比如质量层的幻觉率,可以顺带说一句怎么粗测(有标准答案的问答集做事实校验)——留个钩子让面试官追,把面试引向你熟的领域。
第三步:必须落到业务取舍(本题真正的得分点)
- 客服场景:安全和合规权重最高——答错可以道歉,涉政涉黄零容忍
- 代码场景:正确性优先
- 创作场景:相关性和风格优先
面试官最想听的是你按场景挑维度。
收尾
维度框架是通用的,但具体项目中需要从业务风险出发做裁剪——每个项目都该有自己的评分权重表。
考察重点
| 维度 | 说明 |
|---|---|
| 企业动机 | 考察知识面和结构化能力,能不能按场景取舍而不是背维度清单;有没有业务思维,能不能把评测和业务价值挂上 |
| 过线标准 | 能给出自己的分层框架并解释为什么这么分 |
| 区分度 | 背清单的人和有框架的人差距明显;资深会主动做场景裁剪和权重分配 |
| 减分项 | 一口气报二十个名词不分层,追问两个就露底。宁可少说,每个说透 |
来源
整理自知识星球帖《面试情报 01|大模型测试 20 题》,返回题库。