LLM API Benchmark | скорость AI API, TTFT и чистота моделей
Запустите LLM API benchmark для OpenAI, Claude, Gemini и AI API реле. Измеряйте P95 задержку, TTFT, чистоту модели, prompt cache, лимиты и стоимость токенов.
Краткий ответ
LLM API benchmark сравнивает реальное поведение API разных моделей и провайдеров одинаковыми пробами. AIBench.cc измеряет P95 задержку, TTFT, prompt cache, чистоту модели, лимиты и стоимость токенов, чтобы понять готов ли канал к production.
Как это работает
- 1Выберите OpenAI-compatible, Anthropic Claude или Google Gemini протокол.
- 2Введите base URL, model id и временный тестовый API key.
- 3Запустите проверки связности, задержки, кеша, лимитов, идентичности модели и стоимости.
- 4Изучите отчет и сравните достаточные выборки в рейтинге.
Сценарии
- Сравнить LLM API провайдеров перед закупкой.
- Проверить, стабильно ли AI API реле и не подменяет ли модель.
- Мониторить P95 задержку, TTFT и 429 лимиты при запуске.
- Проверить, снижает ли prompt cache стоимость длинного контекста.
Ключевые метрики
P95 задержка
Сколько времени занимают 95% запросов
TTFT
Время до первого streaming chunk
Чистота модели
Согласованность model field, self-identity и tokenizer signals
Cache hit
Появляются ли cache_read или cached_tokens поля
Почему средней задержки недостаточно
Среднее скрывает всплески. Чаты, агенты и batch-задачи страдают от tail latency, поэтому AIBench отдельно измеряет TTFT и end-to-end P95/P99.
Почему benchmark должен проверять чистоту модели
Один model id может вести к пониженной, quantized или замененной модели. Speed-only тесты поощряют слабые реле, поэтому AIBench использует чистоту модели как входной фильтр.
Связанные запросы
FAQ
Какие метрики важны в LLM API benchmark?
Минимум: P95 задержка, TTFT, success rate, 429 лимиты, prompt cache hit, чистота модели и фактическая стоимость токенов. Средней задержки недостаточно.
Может ли AIBench проверять AI API реле?
Да. Если реле предоставляет OpenAI-compatible API или native Claude/Gemini протокол, можно запустить проверки с временным тестовым ключом.
Руководства и сравнения
Запустить реальную проверку API
Вставьте временный тестовый ключ и проверьте задержку, чистоту модели, кеш, лимиты и стоимость.