AIBench.cc 能检测哪些 LLM API 渠道?
AIBench.cc 支持 OpenAI 兼容接口、Anthropic Claude 原生接口和 Google Gemini 原生接口,也可检测 DeepSeek、Kimi、智谱、通义、豆包等国产 OpenAI 兼容渠道和中转站。
这里只展示已落库且样本达标的真实检测结果;样本不足时不展示模拟排名。
没有黑箱、不靠猜。三步,把渠道的真实表现摆出来。
填入协议、base_url、api_key 与 model,明确这次要审计的是哪个端点和模型。
约 30 秒内发起多轮并发请求,实测延迟分布、缓存命中、限流边界,并用指纹问题比对模型纯度。
输出 SLA 评级与逐项结论,一键分享;匿名结果可聚合进公开行业榜。
想看完整检测方法学?查看检测原理 →
六个维度,每一项都对应你日常调用 API 时真实会踩到的坑。
P50 / P95 / P99 全量采样,首包 TTFT 与端到端分开看,渠道是真快还是抖动一目了然。
核对 cache_read_input_tokens 与 cache_creation,看渠道是否真的走了原生 prompt 缓存,还是替你白付钱。
并发探测 429 / RPM / TPM 边界,给出可用并发与排队行为,免得上线才发现限流。
同一个 model id 背后未必是同一个模型。指纹问题 + tokenizer 行为双重比对,揪出被静默降级、量化或换成小模型的渠道。
按官方价目还原 prompt / completion / cache token,算出每千 token 实际单价 —— 标称便宜不等于真便宜。
测 SSE 首字节与 token 间隔,直接对应对话应用的体感流畅度。
核对响应 model、自我声明与不存在模型探针。
记录 warmup 两次请求里的 cache 读写字段。
拆开 TTFT、chunk 数量与 token 间隔。
综合 URL、响应头和 body id 推断来源置信度。
海内外 13+ 主流大模型原生适配,官方端点与中转站一视同仁。
针对常见搜索和采购问题拆成独立说明页,覆盖 benchmark、OpenAI、Claude、中转站、延迟和模型纯度。
LLM API benchmark 是用统一探针比较不同模型和渠道的真实可用性。AIBench.cc 会测量 P95 延迟、TTFT、缓存命中、模型纯度、限流和 token 成本,帮助你判断一个 AI API 渠道能不能稳定上线。
OpenAI API检测是通过请求连通性、响应 model 字段、P95 延迟、TTFT、cached_tokens、限流响应和 token 计费来判断 API 渠道是否真实可用、是否稳定、是否存在中转异常。
Claude API检测会验证 Anthropic 协议是否可用,并读取 cache_read_input_tokens、cache_creation_input_tokens、ratelimit 响应头、模型身份和 TTFT,判断 Claude 渠道是否稳定、是否真的支持 prompt cache。
API延迟测试不只看平均耗时。AIBench.cc 会分别测端到端 P50/P95/P99、流式 TTFT、chunk 间隔和限流情况,帮助判断 AI API 在真实产品里的体感速度和稳定性。
模型纯度检测是判断你请求的 model id 背后是否真是目标模型。AIBench 会核对响应 model 字段、模型自报身份、tokenizer 计数偏差和协议行为,多项不一致时标记为存疑或降级。
AI API中转站检测要同时看连通性、延迟、模型纯度、缓存字段、限流和计费。只要一个中转站在模型身份、prompt cache 或 P95 延迟上异常,上线后就可能出现质量和成本风险。
面向开发者、采购和渠道运营的快速答案:怎么测模型纯度、缓存命中、延迟和成本。
AIBench.cc 支持 OpenAI 兼容接口、Anthropic Claude 原生接口和 Google Gemini 原生接口,也可检测 DeepSeek、Kimi、智谱、通义、豆包等国产 OpenAI 兼容渠道和中转站。
AIBench 会同时检查响应里的 model 字段、模型自报身份、tokenizer 计数偏差和协议探针结果。多个信号不一致时,报告会把模型纯度标记为存疑或降级。
不会。API key 只用于本次检测请求转发,不写入报告、榜单、日志或数据库。建议使用临时测试 key,检测后在原厂控制台吊销。
P95 延迟表示 95% 请求在该时间内完成,反映整体稳定性;TTFT 是流式响应第一个有效内容 chunk 到达的时间,更接近聊天产品的首字体感。
长上下文场景里,prompt cache 命中会显著降低输入 token 成本和延迟。AIBench 会读取 cache_read_input_tokens、cached_tokens 或 cachedContentTokenCount 等字段,区分原生缓存和网关层缓存。
AIBench 的快检报告适合做渠道筛选、灰度前验收和异常排查。正式采购前仍建议扩大样本量、固定测试地域,并结合你自己的业务 prompt 复测。