Какие метрики важны в LLM API benchmark
Сравнивайте P50/P95/P99, TTFT, success rate, 429, throughput, prompt cache, чистоту модели и реальную token cost в LLM API benchmark.
Краткий ответ
Полезный LLM API benchmark сочетает success rate, P95 latency, TTFT, output speed, 429 behavior, prompt cache, чистоту модели и реальную token cost. Средняя задержка или один speed test не описывают production, а сравнение требует одинаковых model, region, prompt и output length.
Основные выводы
- Среднюю latency дополняйте P95/P99, чтобы видеть хвост распределения.
- Chat зависит от TTFT, batch — от полного времени выполнения.
- Скорость сравнивают только после проверки success rate и чистоты модели.
- Стоимость считают по реальному usage и cache hit.
Разделите метрики на четыре группы
Benchmark для закупки должен покрывать надежность, пользовательскую скорость, качество протокола и экономику. Speed-only тест поощряет каналы с частыми сбоями или тихим downgrade.
| Группа | Основные метрики | На какой вопрос отвечает |
|---|---|---|
| Надежность | Success rate, 5xx, 429, timeout | Стабильно ли завершаются запросы? |
| Скорость | TTFT, P50/P95/P99, output tokens/s | Сколько ждет пользователь? |
| Протокол | Model purity, stream, tools, usage, cache | Полон ли API и нет ли downgrade? |
| Экономика | Input, output и cache token cost | Сколько реально стоит задача? |
Как использовать P50, P95, P99 и среднее
P50 описывает типичный запрос, P95 — медленный хвост, P99 — крайние выбросы. Среднее может скрыть bimodal distribution, поэтому публикуйте percentiles вместе с sample size.
TTFT и output speed — разные показатели
TTFT измеряет время до первого meaningful content chunk. Output tokens/s — скорость генерации после старта. Канал может быстро начать и медленно продолжить или наоборот.
Также проверяйте empty chunks, интервалы, disconnects и финальный usage.
Надежность и rate limits важнее скорости
Считайте 2xx, auth failures, 429, 5xx и timeouts отдельно. Сопоставляйте 429 с headers, retry delay и concurrency limits. Показывайте first-attempt success отдельно от успеха после retry.
Чистота модели, cache и реальная стоимость
Меньшая или quantized модель обычно быстрее, поэтому identity и protocol consistency должны быть входным фильтром рейтинга.
Стоимость считайте по фактическим input, output и cache tokens. Для long context hit rate может быть важнее list price.
Как обеспечить честное сравнение
Фиксируйте model version, prompt, temperature, max tokens, streaming, region и concurrency. Делайте warmup, тестируйте в разные периоды и раскрывайте sample size, обработку ошибок и дату цены.
- Chat: TTFT, P95, stream stability и success rate.
- Agents: tool calls, tail latency, 429 и retry cost.
- Batch: throughput, P99, unit cost и recovery.
- Long context: cache hit, input cost и context limits.
Частые вопросы
Сколько запросов нужно для LLM API benchmark?
Малой выборки хватает для отбора. Закупка и SLA требуют больших выборок в разные периоды с опубликованным sample size; P95/P99 нестабильны при малом числе наблюдений.
Что важнее: TTFT или total latency?
Chat важнее TTFT и stream stability, batch — completion time и throughput. Вес зависит от workload.
Почему недостаточно официальной цены?
Фактическая стоимость зависит от output length, cache hits, retries и downgrade. Считайте cost per completed task по usage.
Читайте также
Запустите проверку реального API
Используйте временный key для проверки связности, задержки, кеша, лимитов, чистоты модели и token cost.