10 LLM-as-a-Judge 是什么?有哪些坑?
2026/9/1...大约 2 分钟
10|LLM-as-a-Judge 是什么?有哪些坑?
开场先给定义和定位:用强模型按评分标准(rubric)给被测输出打分或判对错,解决的是中间地带——人工评不动、规则又写不全的那部分规模化评测。
回答思路
第一步:讲怎么用对
- rubric 要具体到每一档有行为描述——「相关性 1-5 分」必须写出每档特征
- judge 和被测模型最好异源,规避家族偏好
- 重要判定交换顺序评多次取多数
第二步:坑展开——本题得分主体,至少讲三个
| 坑 | 表现 |
|---|---|
| 位置偏差 | 偏爱先出现的答案 |
| 长度偏差 | 把长当做好 |
| 自我偏好 | 偏爱自己体系的模型 |
| 能力上限 | judge 分不清的领域照样分不清——拿 GPT 级 judge 评专业医学内容未必靠谱 |
| rubric 模糊 | 分数抖动,同一答案两次评分不一致 |
第三步:校准机制,体现你不是只会用
定期拿人工标注做对照,算 judge 和人的一致率——一致率掉下来,先修 rubric 或换 judge,而不是继续信结果。
收尾:给定位结论
judge 负责大规模初筛,人聚焦分歧和高风险样本——它是效率工具,不是为了替代人。
考察重点
| 维度 | 说明 |
|---|---|
| 企业动机 | 实操检测题。背概念的和踩过坑的,讲偏差那段一听就分出来。评测规模上不去是行业普遍瓶颈,judge 是当前主流解法,企业要会用更要会防坑的人 |
| 过线标准 | 定义清楚 + 至少两个坑 + 有校准意识 |
| 区分度 | 背概念的人讲不出偏差细节;踩过坑的人能讲「一致率掉了怎么办」的处置动作 |
| 加分项 | 讲 judge 和人工的分工比例这类落地经验——比如 judge 跑全量、人工抽 10% 校准,一句话证明真跑过 |
来源
整理自知识星球帖《面试情报 01|大模型测试 20 题》,返回题库。