Benchmark

LLM API Benchmark | скорость AI API, TTFT и чистота моделей

Запустите LLM API benchmark для OpenAI, Claude, Gemini и AI API реле. Измеряйте P95 задержку, TTFT, чистоту модели, prompt cache, лимиты и стоимость токенов.

Краткий ответ

LLM API benchmark сравнивает реальное поведение API разных моделей и провайдеров одинаковыми пробами. AIBench.cc измеряет P95 задержку, TTFT, prompt cache, чистоту модели, лимиты и стоимость токенов, чтобы понять готов ли канал к production.

Как это работает

  1. 1Выберите OpenAI-compatible, Anthropic Claude или Google Gemini протокол.
  2. 2Введите base URL, model id и временный тестовый API key.
  3. 3Запустите проверки связности, задержки, кеша, лимитов, идентичности модели и стоимости.
  4. 4Изучите отчет и сравните достаточные выборки в рейтинге.

Сценарии

  • Сравнить LLM API провайдеров перед закупкой.
  • Проверить, стабильно ли AI API реле и не подменяет ли модель.
  • Мониторить P95 задержку, TTFT и 429 лимиты при запуске.
  • Проверить, снижает ли prompt cache стоимость длинного контекста.

Ключевые метрики

P95 задержка

Сколько времени занимают 95% запросов

TTFT

Время до первого streaming chunk

Чистота модели

Согласованность model field, self-identity и tokenizer signals

Cache hit

Появляются ли cache_read или cached_tokens поля

Почему средней задержки недостаточно

Среднее скрывает всплески. Чаты, агенты и batch-задачи страдают от tail latency, поэтому AIBench отдельно измеряет TTFT и end-to-end P95/P99.

Почему benchmark должен проверять чистоту модели

Один model id может вести к пониженной, quantized или замененной модели. Speed-only тесты поощряют слабые реле, поэтому AIBench использует чистоту модели как входной фильтр.

Связанные запросы

LLM API benchmarkAI API speed testOpenAI API checkClaude API checkmodel purity testprompt cache

FAQ

Какие метрики важны в LLM API benchmark?

Минимум: P95 задержка, TTFT, success rate, 429 лимиты, prompt cache hit, чистота модели и фактическая стоимость токенов. Средней задержки недостаточно.

Может ли AIBench проверять AI API реле?

Да. Если реле предоставляет OpenAI-compatible API или native Claude/Gemini протокол, можно запустить проверки с временным тестовым ключом.

Руководства и сравнения

Запустить реальную проверку API

Вставьте временный тестовый ключ и проверьте задержку, чистоту модели, кеш, лимиты и стоимость.

Начать тест