При развертывании Agentforce компании Salesforce нужно было обеспечить высокую доступность моделей в нескольких зонах доступности. Как сообщает AWS Machine Learning Blog, совместное размещение нескольких моделей на общих GPU с помощью Amazon SageMaker AI Inference Components позволило Salesforce сократить затраты на инфраструктуру в 8 раз. Однако стандартный алгоритм не гарантировал, что копии конкретной модели будут равномерно распределены между зонами. Это не отвечало внутреннему требованию компании: каждая промышленная модель должна поддерживать 2 AZ.
Для управления размещением AWS добавила параметр SchedulingConfig в CreateInferenceComponent API. Настройка AvailabilityZoneBalance отвечает за баланс копий между зонами с заданным допустимым отклонением. Параметр PlacementStrategy определяет размещение внутри каждой зоны. Стратегия SPREAD распределяет копии по максимально возможному числу инстансов, а BINPACK концентрирует их на меньшем числе инстансов.
В описанном сценарии endpoint включает 4 инстанса, поровну распределенных между 2 AZ. При запуске 4 копий модели стратегия SPREAD размещает по 2 копии в каждой зоне. Значение MaxImbalance: 1 допускает разницу не более чем в 1 копию. Если у модели 2 копии, параметр MaxImbalance: 0 обеспечивает размещение ровно по 1 копии в каждой AZ.
При увеличении CopyCount SageMaker размещает дополнительные копии с учетом заданного баланса между AZ. При уменьшении CopyCount сервис удаляет копии из разных зон симметрично.
Ключевые факты
Совместное размещение нескольких моделей на общих GPU снизило затраты Salesforce на инфраструктуру в 8 раз.
Внутренние требования Salesforce предусматривают поддержку 2 AZ для каждой промышленной модели.
При MaxImbalance: 1 разница между любыми двумя AZ не должна превышать 1 копию.
Для 2 копий модели MaxImbalance: 0 обеспечивает размещение ровно по 1 копии в каждой AZ.
Вопросы и ответы
- Какой экономический эффект дает совместное размещение моделей на общих GPU?
Использование SageMaker AI Inference Components снизило затраты Salesforce на инфраструктуру в 8 раз.
- Как гарантировать отказоустойчивость модели в двух зонах доступности?
Для модели с 2 копиями параметр MaxImbalance: 0 размещает ровно по 1 копии в каждой из 2 AZ, что соответствует внутреннему требованию Salesforce для промышленных моделей.
- Чем отличаются стратегии SPREAD и BINPACK?
SPREAD распределяет копии по максимально возможному числу инстансов внутри каждой зоны, а BINPACK концентрирует их на меньшем числе инстансов. Например, при 4 инстансах в 2 AZ и 4 копиях SPREAD размещает по 2 копии в каждой зоне.
Контекст по теме
- Deepgram расширила наблюдаемость STT- и TTS-моделей в Amazon SageMaker AI27 августа 2026 г.
- AWS показала схему мониторинга ML-моделей в SageMaker AI с использованием MLflow и Evidently7 июля 2026 г.
- AWS описала пять паттернов отказоустойчивости для приложений с LLM на Amazon Bedrock30 июня 2026 г.
- В Amazon SageMaker AI представили container image caching для ускорения масштабирования моделей16 июня 2026 г.
