AIBench.cc
API 渠道审计 · 全协议 · 可分享报告

你买的是Opus 4.8跑出来真的是Opus 4.8吗?

一次检测,验证延迟 / 缓存 / 模型纯度 / 限流OpenAI · Anthropic · Gemini · 国产协议通用。

已记录真实检测1,277行业榜持续更新开源可审计
真实检测 · 持续累积中详情 →
1,277
真实检测次数
316A·优秀
540B·合格
392C·存疑

渠道检测配置

填入协议、接口地址、API Key 和模型名,生成可分享的渠道审计报告。

协议
国产厂商预设,一键填 base_url

API Key 仅用于本次检测请求,不写入报告、榜单或日志。

预计 ~30s · 多轮探针采样 · 算法核心开源

~30s
平均检测耗时
真实报告均值
13
真实渠道数
来自已落库报告
7
检测维度
延迟 / 纯度 / 成本 …
最近 24h · 榜单预览

谁家渠道真的稳?

这里只展示已落库且样本达标的真实检测结果;样本不足时不展示模拟排名。

查看完整榜单
官方直连claude-sonnet-4-5A 95%2h 前
官方直连gpt-4oA 93%1h 前
channel-7xgpt-4oA 90%1h 前
官方直连deepseek-chatA 89%3h 前
官方直连kimi-k2A 86%2h 前
官方直连claude-sonnet-4-5A 95%2h 前
官方直连gpt-4oA 93%1h 前
channel-7xgpt-4oA 90%1h 前
官方直连deepseek-chatA 89%3h 前
官方直连kimi-k2A 86%2h 前
01
官方直连
claude-sonnet-4-5
0.82s
94%
A
2h 前
02
官方直连
gpt-4o
0.88s
90%
A
1h 前
03
channel-7x
gpt-4o
0.91s
88%
A
1h 前
04
官方直连
deepseek-chat
1.04s
91%
A
3h 前
05
官方直连
kimi-k2
1.10s
80%
A
2h 前

工作原理

没有黑箱、不靠猜。三步,把渠道的真实表现摆出来。

01

配置渠道

填入协议、base_url、api_key 与 model,明确这次要审计的是哪个端点和模型。

02

并发探针采样

约 30 秒内发起多轮并发请求,实测延迟分布、缓存命中、限流边界,并用指纹问题比对模型纯度。

03

生成可分享报告

输出 SLA 评级与逐项结论,一键分享;匿名结果可聚合进公开行业榜。

想看完整检测方法学?查看检测原理 →

检测维度

六个维度,每一项都对应你日常调用 API 时真实会踩到的坑。

延迟分布

P50 / P95 / P99 全量采样,首包 TTFT 与端到端分开看,渠道是真快还是抖动一目了然。

缓存命中

核对 cache_read_input_tokens 与 cache_creation,看渠道是否真的走了原生 prompt 缓存,还是替你白付钱。

限流策略

并发探测 429 / RPM / TPM 边界,给出可用并发与排队行为,免得上线才发现限流。

模型纯度

同一个 model id 背后未必是同一个模型。指纹问题 + tokenizer 行为双重比对,揪出被静默降级、量化或换成小模型的渠道。

真实成本

按官方价目还原 prompt / completion / cache token,算出每千 token 实际单价 —— 标称便宜不等于真便宜。

流式 TTFT

测 SSE 首字节与 token 间隔,直接对应对话应用的体感流畅度。

检测证据预览

不是只给分数,每条风险都有过程可查。

查看方法学 →

模型身份

核对响应 model、自我声明与不存在模型探针。

modelfingerprint404

缓存证据

记录 warmup 两次请求里的 cache 读写字段。

cache_readcache_write

流式质量

拆开 TTFT、chunk 数量与 token 间隔。

TTFTchunks

渠道来源

综合 URL、响应头和 body id 推断来源置信度。

headersbody_id

厂商覆盖

海内外 13+ 主流大模型原生适配,官方端点与中转站一视同仁。

OpenAIAnthropic ClaudeGoogle GeminiMiniMax腾讯混元
DeepSeekKimi (Moonshot)豆包 (Doubao)阶跃星辰 Step
智谱 GLM通义千问百度文心讯飞星火

AI API 检测工具

针对常见搜索和采购问题拆成独立说明页,覆盖 benchmark、OpenAI、Claude、中转站、延迟和模型纯度。

查看 LLM API Benchmark

LLM API 检测常见问题

面向开发者、采购和渠道运营的快速答案:怎么测模型纯度、缓存命中、延迟和成本。

AIBench.cc 能检测哪些 LLM API 渠道?

AIBench.cc 支持 OpenAI 兼容接口、Anthropic Claude 原生接口和 Google Gemini 原生接口,也可检测 DeepSeek、Kimi、智谱、通义、豆包等国产 OpenAI 兼容渠道和中转站。

如何判断 LLM API 中转站有没有偷换模型?

AIBench 会同时检查响应里的 model 字段、模型自报身份、tokenizer 计数偏差和协议探针结果。多个信号不一致时,报告会把模型纯度标记为存疑或降级。

AIBench 会保存我的 API key 吗?

不会。API key 只用于本次检测请求转发,不写入报告、榜单、日志或数据库。建议使用临时测试 key,检测后在原厂控制台吊销。

API 延迟 P95 和 TTFT 有什么区别?

P95 延迟表示 95% 请求在该时间内完成,反映整体稳定性;TTFT 是流式响应第一个有效内容 chunk 到达的时间,更接近聊天产品的首字体感。

prompt cache 命中为什么重要?

长上下文场景里,prompt cache 命中会显著降低输入 token 成本和延迟。AIBench 会读取 cache_read_input_tokens、cached_tokens 或 cachedContentTokenCount 等字段,区分原生缓存和网关层缓存。

检测结果能作为采购依据吗?

AIBench 的快检报告适合做渠道筛选、灰度前验收和异常排查。正式采购前仍建议扩大样本量、固定测试地域,并结合你自己的业务 prompt 复测。

把渠道质量摆到台面上

报告可一键分享。匿名结果聚合进公开榜单,让真正稳的渠道被看见,把偷工减料的晾出来。