Benchmark
LLM API Benchmark|AI API测速、延迟与模型纯度检测
AIBench.cc 提供 LLM API benchmark:对 OpenAI、Claude、Gemini 与中转站做 API延迟测试、模型纯度检测、缓存命中和 token 成本对比。
快速答案
LLM API benchmark 是用统一探针比较不同模型和渠道的真实可用性。AIBench.cc 会测量 P95 延迟、TTFT、缓存命中、模型纯度、限流和 token 成本,帮助你判断一个 AI API 渠道能不能稳定上线。
检测步骤
- 1选择 OpenAI 兼容、Anthropic Claude 或 Google Gemini 协议。
- 2填写 base URL、模型名和临时测试 key。
- 3运行连通性、延迟、缓存、限流、模型身份和成本探针。
- 4生成可分享报告,并在样本达标后聚合到行业榜。
适用场景
- 采购前比较多个 LLM API 供应商。
- 上线前验证中转站是否稳定、是否偷换模型。
- 灰度期间监控 P95 延迟、TTFT 与 429 限流。
- 核算 prompt cache 是否真的降低长上下文成本。
核心指标
P95 延迟
95% 请求完成耗时
TTFT
流式首个有效内容到达时间
模型纯度
model 字段、自报身份与 tokenizer 信号一致性
缓存命中
cache_read / cached_tokens 等字段是否出现
为什么不能只看平均延迟
平均值会掩盖抖动。聊天、Agent 和批处理任务真正害怕的是 P95/P99 尾延迟,所以 AIBench 把首包 TTFT 和端到端耗时分开记录。
为什么 benchmark 要包含模型纯度
同一个 model id 背后可能是降级、量化或替换后的模型。只测速度会奖励低质量渠道,所以 AIBench 把模型纯度作为前置门槛。
相关搜索词
LLM API benchmarkAI API测速API延迟测试模型纯度检测token 成本prompt cache
常见问题
LLM API benchmark 应该看哪些指标?
至少要看 P95 延迟、TTFT、成功率、429 限流、prompt cache 命中、模型纯度和实际 token 成本。只看平均延迟容易误判。
AIBench.cc 的 benchmark 是否支持中转站?
支持。只要中转站提供 OpenAI 兼容接口,或提供 Claude/Gemini 原生接口,就可以用临时测试 key 发起检测。
相关指南与对比
开始一次真实检测
粘贴临时测试 key,用同一套探针查看延迟、模型纯度、缓存、限流和成本。