11 人工评估怎么设计才靠谱?
2026/9/1...大约 2 分钟
11|人工评估怎么设计才靠谱?
开场先给立场:人工评估不是拍脑袋打分,它本身是一个需要质量保证的测量系统——这句话能立刻把你和「找几个人看看」区分开。
回答思路
第一步:设计展开四点
- rubric 每档有行为描述,先小样本校准再放量
- 多人背靠背盲评,不告知输出来源和版本,防锚定效应
- 分层抽样:自动指标和 judge 先筛,人力聚焦分歧样本和高风险样本
- 评前培训统一尺度,拿同一批样本对齐理解
第二步:多人盲评要算评分者一致性
百分比一致或 Kappa。一致性低说明 rubric 有歧义——先修标准再继续,不要硬出结论。能说出这句话,测量素养直接上一个台阶。
第三步:成本控制
用「自动指标初筛 + judge 中筛 + 人工精判」的三层漏斗,把人花在刀刃上。
收尾:评估结论要带上下文汇报
样本量、一致性系数、评分分布——只报一个平均分的是没做过的人。
考察重点
| 维度 | 说明 |
|---|---|
| 企业动机 | 数据素养:会不会算一致性、知不知道评估要闭环。人工评估的结论在公司里经常被质疑「太主观」,企业要能让结论站得住、扛得住挑战的人 |
| 过线标准 | rubric 校准 + 盲评 + 一致性检验,三点齐全 |
| 区分度 | 会算一致性、知道先修标准再放量的是学过测量或真做过的;只会「找几个人打分取平均」的是外行 |
| 减分项 | 把人工评估一棍子打死说「没用」——极端化认知同样扣分,正确姿态是讲它和自动评估怎么配合 |
来源
整理自知识星球帖《面试情报 01|大模型测试 20 题》,返回题库。