Latency
API延迟测试|AI API测速、P95延迟与TTFT检测
用 AIBench.cc 做 AI API延迟测试:测 OpenAI、Claude、Gemini 与中转站的 P50/P95/P99、TTFT、流式速度和 429 限流。
快速答案
API延迟测试不只看平均耗时。AIBench.cc 会分别测端到端 P50/P95/P99、流式 TTFT、chunk 间隔和限流情况,帮助判断 AI API 在真实产品里的体感速度和稳定性。
检测步骤
- 1用同一模型和 prompt 发起多轮请求。
- 2分别记录非流式端到端耗时和流式 TTFT。
- 3统计 P50/P95/P99,观察尾延迟和抖动。
- 4结合 429、5xx 与成功率判断稳定性。
适用场景
- 比较多个 API 渠道的真实首字速度。
- 排查用户反馈的聊天响应慢。
- 为 Agent 工作流选择低尾延迟渠道。
- 监控上线后 API 抖动和限流。
核心指标
P50
典型请求耗时
P95
尾延迟和稳定性
TTFT
首个有效内容 chunk
成功率
请求是否稳定完成
为什么 TTFT 比总耗时更接近体感
聊天产品里用户先看到第一个 token 就会觉得系统开始响应,所以 TTFT 往往比完整生成时间更能解释体感速度。
为什么要看 P95
线上体验由慢请求决定。P95 可以暴露排队、网关拥塞、限流和跨境网络抖动,比平均值更适合做 SLA 判断。
相关搜索词
API延迟测试AI API测速TTFT检测P95延迟LLM latency benchmark
常见问题
API延迟测试需要测多少次?
快检可以先跑少量探针做初筛;采购或 SLA 决策建议固定地域、固定 prompt,扩大样本量并分时段复测。
TTFT 和 P95 延迟哪个更重要?
聊天场景更关注 TTFT 和流式稳定性;批处理场景更关注端到端 P95/P99 和成功率。
相关指南与对比
开始一次真实检测
粘贴临时测试 key,用同一套探针查看延迟、模型纯度、缓存、限流和成本。