К содержанию
Новости

Together AI описала подход к автоскейлингу LLM-инференса с учетом очередей и холодного старта

Together AI описала подход к автоскейлингу LLM-инференса с учетом очередей и холодного старта

Together AI опубликовала рекомендации по настройке автоскейлинга для выделенных LLM-инференс-развертываний. Платформа предлагает масштабировать сервисы по метрикам, связанным с самим инференсом: числу активных запросов, TTFT, загрузке GPU и пропускной способности по токенам. Пользователь может задать минимальное и максимальное число реплик, выбрать целевую метрику, а также настроить окна времени для масштабирования вверх и вниз.

Как сообщает Together AI Blog, для LLM-нагрузок классические подходы к автоскейлингу подходят хуже из-за специфики GPU-инференса. В компании отмечают, что загрузка GPU может оставаться на уровне 60%, даже если очередь запросов уже растет. Причина в том, что этот показатель отражает вычислительную интенсивность, а не давление на систему. Кроме того, запуск новой реплики занимает несколько минут: серверу нужно получить десятки гигабайт весов, загрузить их в VRAM и прогреть модель.

В статье приводят пример деградации задержек при нехватке реплик. Если система упирается в лимит конкурентных запросов, TTFT может вырасти с 200 мс до 15 секунд. Для таких сценариев Together AI использует пропорциональный цикл масштабирования, в котором число требуемых реплик рассчитывается через отношение наблюдаемой нагрузки к целевому значению. Чтобы сгладить колебания, отдельно настраиваются окна scale_up_window и scale_down_window. По умолчанию scale_down_window составляет 5 минут.

Ключевые факты

  • Together AI поддерживает автоскейлинг по in-flight requests, TTFT, GPU utilization и token throughput

  • В примере из статьи TTFT может увеличиться с 200 мс до 15 секунд при переполнении очереди запросов

  • scale_down_window для автоскейлинга по умолчанию установлен на 5 минут

  • Новая реплика для LLM-инференса может запускаться несколько минут из-за загрузки десятков гигабайт весов в VRAM

Вопросы и ответы

Почему автоскейлинг по загрузке GPU может не сработать для LLM-инференса?

Для LLM-нагрузок GPU utilization не отражает давление очереди: загрузка может оставаться на уровне 60%, пока запросы уже накапливаются. Together AI рекомендует ориентироваться на in-flight requests, TTFT и token throughput, а не только на GPU.

Что происходит с задержкой, если реплик не хватает под пиковую нагрузку?

В примере Together AI TTFT увеличивается с 200 мс до 15 секунд, когда система упирается в лимит конкурентных запросов и очередь переполняется.

Почему новые реплики для LLM запускаются медленно и как это учитывается в автоскейлинге?

Запуск новой реплики может занимать несколько минут, потому что серверу нужно загрузить десятки гигабайт весов в VRAM и прогреть модель. Для сглаживания таких задержек scale_down_window по умолчанию установлен на 5 минут.

Контекст по теме