Руководство

Какие метрики важны в LLM API benchmark

Сравнивайте P50/P95/P99, TTFT, success rate, 429, throughput, prompt cache, чистоту модели и реальную token cost в LLM API benchmark.

Обновлено 13 июля 2026 г.Около 9 минутРедакция AIBench.cc

Краткий ответ

Полезный LLM API benchmark сочетает success rate, P95 latency, TTFT, output speed, 429 behavior, prompt cache, чистоту модели и реальную token cost. Средняя задержка или один speed test не описывают production, а сравнение требует одинаковых model, region, prompt и output length.

Основные выводы

  • Среднюю latency дополняйте P95/P99, чтобы видеть хвост распределения.
  • Chat зависит от TTFT, batch — от полного времени выполнения.
  • Скорость сравнивают только после проверки success rate и чистоты модели.
  • Стоимость считают по реальному usage и cache hit.

Разделите метрики на четыре группы

Benchmark для закупки должен покрывать надежность, пользовательскую скорость, качество протокола и экономику. Speed-only тест поощряет каналы с частыми сбоями или тихим downgrade.

ГруппаОсновные метрикиНа какой вопрос отвечает
НадежностьSuccess rate, 5xx, 429, timeoutСтабильно ли завершаются запросы?
СкоростьTTFT, P50/P95/P99, output tokens/sСколько ждет пользователь?
ПротоколModel purity, stream, tools, usage, cacheПолон ли API и нет ли downgrade?
ЭкономикаInput, output и cache token costСколько реально стоит задача?

Как использовать P50, P95, P99 и среднее

P50 описывает типичный запрос, P95 — медленный хвост, P99 — крайние выбросы. Среднее может скрыть bimodal distribution, поэтому публикуйте percentiles вместе с sample size.

TTFT и output speed — разные показатели

TTFT измеряет время до первого meaningful content chunk. Output tokens/s — скорость генерации после старта. Канал может быстро начать и медленно продолжить или наоборот.

Также проверяйте empty chunks, интервалы, disconnects и финальный usage.

Надежность и rate limits важнее скорости

Считайте 2xx, auth failures, 429, 5xx и timeouts отдельно. Сопоставляйте 429 с headers, retry delay и concurrency limits. Показывайте first-attempt success отдельно от успеха после retry.

Чистота модели, cache и реальная стоимость

Меньшая или quantized модель обычно быстрее, поэтому identity и protocol consistency должны быть входным фильтром рейтинга.

Стоимость считайте по фактическим input, output и cache tokens. Для long context hit rate может быть важнее list price.

Как обеспечить честное сравнение

Фиксируйте model version, prompt, temperature, max tokens, streaming, region и concurrency. Делайте warmup, тестируйте в разные периоды и раскрывайте sample size, обработку ошибок и дату цены.

  • Chat: TTFT, P95, stream stability и success rate.
  • Agents: tool calls, tail latency, 429 и retry cost.
  • Batch: throughput, P99, unit cost и recovery.
  • Long context: cache hit, input cost и context limits.

Частые вопросы

Сколько запросов нужно для LLM API benchmark?

Малой выборки хватает для отбора. Закупка и SLA требуют больших выборок в разные периоды с опубликованным sample size; P95/P99 нестабильны при малом числе наблюдений.

Что важнее: TTFT или total latency?

Chat важнее TTFT и stream stability, batch — completion time и throughput. Вес зависит от workload.

Почему недостаточно официальной цены?

Фактическая стоимость зависит от output length, cache hits, retries и downgrade. Считайте cost per completed task по usage.

Читайте также

Запустите проверку реального API

Используйте временный key для проверки связности, задержки, кеша, лимитов, чистоты модели и token cost.

Начать тест