16 大模型应用的性能测试关注什么?和传统性能测试的区别?
2026/9/1...大约 2 分钟
16|大模型应用的性能测试关注什么?和传统性能测试的区别?
开场把指标体系分类讲,再进「区别」。
回答思路
第一步:指标体系分类讲
- 时延:首 token 时延 TTFT(流式场景的命门,用户等的就是第一个字出来)、完整回答时延、分段输出间隔
- 吞吐:tokens/s、并发用户数、QPS
- 长尾:P95、P99 和超时率——大模型服务的长尾比传统服务陡得多
第二步:大模型特有的变量——「区别」部分的得分主体
- 上下文长度显著影响时延和成本:长 prompt 又慢又贵,测试必须按上下文长度分档设计场景
- 模型服务的弹性扩缩容和排队机制与传统服务不同,压测时 ramp-up 曲线要专门观察
- 成本:token 消耗量本身就是性能工程指标,压测方案里要算成本账——这是传统性能测试完全没有的维度
第三步:场景设计
单轮短问答、长上下文、多轮会话、流式高并发——分别建模分别压,不能用一个平均场景糊过去。
收尾:迁移老本行
分层压测、容量规划、瓶颈定位这些传统方法论照样适用,只是指标体系和成本模型要重建——这句收尾让面试官看到你的经验是资产不是包袱。
考察重点
| 维度 | 说明 |
|---|---|
| 企业动机 | 大模型服务又贵又慢,性能直接吃成本和体验。企业要能把传统性能方法迁移过来的老手,而不是从头学的新人 |
| 过线标准 | 说出 TTFT、tokens/s、P95 这些大模型侧指标 |
| 区分度 | 能讲上下文长度分档、token 成本核算的是真压测过大模型服务;只会报 TPS 的是没碰过 |
| 加分项 | 流式体验的分段时延视角,说明真的站在用户角度想过 |
来源
整理自知识星球帖《面试情报 01|大模型测试 20 题》,返回题库。