Together AI описала подход к автоскейлингу LLM-инференса с учетом очередей и холодного старта
Together AI опубликовала рекомендации по настройке автоскейлинга для выделенных LLM-инференс-развертываний. Платформа предлагает масштабировать сервисы по метрикам, связанным с самим инференсом: числу активных запросов, TTFT, загрузке GPU и пропускной способности по токенам. Пользователь может задать минимальное и максимальное число реплик, выбрать целевую метрику, а также настроить окна времени для масштабирования вверх и вниз.
Как сообщает Together AI Blog, для LLM-нагрузок классические подходы к автоскейлингу подходят хуже из-за специфики GPU-инференса. В компании отмечают, что загрузка GPU может оставаться на уровне 60%, даже если очередь запросов уже растет. Причина в том, что этот показатель отражает вычислительную интенсивность, а не давление на систему. Кроме того, запуск новой реплики занимает несколько минут: серверу нужно получить десятки гигабайт весов, загрузить их в VRAM и прогреть модель.
В статье приводят пример деградации задержек при нехватке реплик. Если система упирается в лимит конкурентных запросов, TTFT может вырасти с 200 мс до 15 секунд. Для таких сценариев Together AI использует пропорциональный цикл масштабирования, в котором число требуемых реплик рассчитывается через отношение наблюдаемой нагрузки к целевому значению. Чтобы сгладить колебания, отдельно настраиваются окна scale_up_window и scale_down_window. По умолчанию scale_down_window составляет 5 минут.
Ключевые факты
Together AI поддерживает автоскейлинг по in-flight requests, TTFT, GPU utilization и token throughput
В примере из статьи TTFT может увеличиться с 200 мс до 15 секунд при переполнении очереди запросов
scale_down_window для автоскейлинга по умолчанию установлен на 5 минут
Новая реплика для LLM-инференса может запускаться несколько минут из-за загрузки десятков гигабайт весов в VRAM
Вопросы и ответы
- Почему автоскейлинг по загрузке GPU может не сработать для LLM-инференса?
Для LLM-нагрузок GPU utilization не отражает давление очереди: загрузка может оставаться на уровне 60%, пока запросы уже накапливаются. Together AI рекомендует ориентироваться на in-flight requests, TTFT и token throughput, а не только на GPU.
- Что происходит с задержкой, если реплик не хватает под пиковую нагрузку?
В примере Together AI TTFT увеличивается с 200 мс до 15 секунд, когда система упирается в лимит конкурентных запросов и очередь переполняется.
- Почему новые реплики для LLM запускаются медленно и как это учитывается в автоскейлинге?
Запуск новой реплики может занимать несколько минут, потому что серверу нужно загрузить десятки гигабайт весов в VRAM и прогреть модель. Для сглаживания таких задержек scale_down_window по умолчанию установлен на 5 минут.
Контекст по теме
- Together AI обновила GPU-кластеры для обучения и инференса моделей15 июля 2026 г.
- KDnuggets перечислил подходы к снижению задержек и стоимости LLM в продакшене14 июля 2026 г.
- Как запускать крупные LLM на видеокартах с 4–12 ГБ VRAM: практические приёмы локального инференса23 июня 2026 г.
- NVIDIA: метод DFlash Speculative Decoding повышает производительность инференса на Blackwell до 15 раз23 июня 2026 г.