Latency

API Latency Test | скорость AI API, P95 задержка и TTFT

Тестируйте задержку AI API для OpenAI, Claude, Gemini и реле: P50/P95/P99, TTFT, streaming speed и 429 лимиты.

Краткий ответ

API latency test не должен смотреть только среднее время. AIBench отдельно измеряет end-to-end P50/P95/P99, streaming TTFT, chunk interval и rate-limit signals, чтобы показать реальную отзывчивость и стабильность продукта.

Как это работает

  1. 1Отправьте несколько запросов с одной моделью и prompt.
  2. 2Отдельно запишите non-streaming end-to-end latency и streaming TTFT.
  3. 3Посчитайте P50/P95/P99, чтобы увидеть tail latency и jitter.
  4. 4Совместите 429, 5xx и success rate для оценки стабильности.

Сценарии

  • Сравнить first-token speed разных API каналов.
  • Разобрать медленные ответы в чат-продукте.
  • Выбрать канал с низкой tail latency для agent workflows.
  • Мониторить jitter и rate limits после запуска.

Ключевые метрики

P50

Типичная задержка запроса

P95

Tail latency и стабильность

TTFT

Первый streaming content chunk

Success rate

Надежно ли завершаются запросы

Почему TTFT ближе к восприятию пользователя

В чатах пользователь чувствует ответ, когда появляется первый token. TTFT часто лучше объясняет perceived speed, чем полное время генерации.

Почему важен P95

Опыт пользователя определяется медленными запросами. P95 лучше среднего показывает queueing, gateway congestion, rate limits и cross-region jitter.

Связанные запросы

API latency testAI API speed testTTFT checkP95 latencyLLM latency benchmark

FAQ

Сколько запросов нужно для API latency test?

Quick check может начинаться с малой выборки. Для закупки или SLA нужны фиксированные регионы, фиксированные prompt, большая выборка и повторные окна.

Что важнее: TTFT или P95?

Чаты больше зависят от TTFT и stream stability; batch jobs - от end-to-end P95/P99 и success rate.

Руководства и сравнения

Запустить реальную проверку API

Вставьте временный тестовый ключ и проверьте задержку, чистоту модели, кеш, лимиты и стоимость.

Начать тест