04 响应时间为什么看 P95、P99 而不是平均值?
2026/9/14...大约 2 分钟
04|响应时间为什么看 P95、P99 而不是平均值?
开场先讲平均值为什么骗人——长尾意识是性能从业者和技术外行的分水岭。
回答思路
第一步:平均值的欺骗性
性能数据是长尾分布:一百个请求里九十个 50ms、十个 5 秒——平均值 500 多毫秒看起来还行,但十个 5 秒的用户已经流失了。平均值把最痛的那批人平均没了。
第二步:讲分位值的含义
- P95:所有响应时间排序后第 95 百分位的值——95% 的用户体验不超过这个数
- P99:管的是最糟的 1%
分位值直接回答「绝大多数用户体验如何」和「最差体验有多差」两个问题。
第三步:讲业务上的用法
C 端交易链路看 P99(每个用户都值钱),内部系统看 P95 甚至 P90,SLA 承诺用分位值写(P99 < 1s)——指标口径和业务重要性挂钩,不是一刀切。
第四步:讲长尾的来源
慢查询、GC 停顿、缓存穿透、冷启动、锁竞争——尾部延迟往往是系统性问题的前兆。P99 的抖动常常比平均值的劣化更早暴露问题,监控长尾是提前预警。
收尾:补一个工程细节
样本量要够大分位值才可信——压测只发两百个请求谈 P99 没有意义。分位值和样本量的关系能讲出来,说明真做过数据分析。
考察重点
| 维度 | 说明 |
|---|---|
| 企业动机 | 企业通过这题看你是「跑完报个数」还是「会读数据」——后者才是能做瓶颈分析的人 |
| 过线标准 | 平均值的欺骗性 + P95/P99 的含义 |
| 区分度 | 讲分位值和业务分级挂钩、讲长尾是问题前兆的是生产视角;只会定义的是背题 |
| 加分项 | 样本量和分位值可信度的关系 |
| 减分项 | 报结果只报平均 RT,暴露数据素养不足 |
来源
整理自知识星球帖《面试情报 04|性能测试 20 题》,返回题库。