Как сообщает AWS Machine Learning Blog, AWS, NVIDIA и Heidi Health показали конфигурацию для обслуживания модели NVIDIA Parakeet TDT 0.6B V2 на Amazon EC2. Она позволяет сократить число необходимых GPU-инстансов с 16 до 4. Связка NVIDIA CUDA MPS и NVIDIA Triton Inference Server сохраняет задержку менее секунды при нагрузке 92,1 запроса в секунду на один GPU.
Один запрос к модели использует примерно 15–20% вычислительной мощности NVIDIA L40S, поэтому около 80% оборудования остается незагруженным. При стандартном разделении времени процессы обращаются к GPU по очереди, а переключение контекста создает дополнительные накладные расходы. В результате один GPU обрабатывает около 62 запросов в секунду. Средняя задержка составляет менее 650 мс, p99 не превышает 1 000 мс.
MPS решает эту проблему за счет общего контекста GPU. Ядра разных процессов могут одновременно выполняться на разных потоковых мультипроцессорах, причем менять код для этого не нужно. В описанной конфигурации GPU разделен между четырьмя параллельными экземплярами, каждый получает по 25% потоковых мультипроцессоров.
Ключевые факты
Heidi Health обрабатывает более 2,4 млн клинических консультаций в неделю в 190 странах.
Один запрос к NVIDIA Parakeet TDT 0.6B V2 использует примерно 15–20% из 142 потоковых мультипроцессоров NVIDIA L40S.
При стандартном разделении времени один GPU обрабатывает около 62 запросов в секунду при средней задержке менее 650 мс и p99 менее 1 000 мс.
Конфигурация с MPS обеспечивает 92,1 запроса в секунду на один GPU при задержке менее секунды.
Вопросы и ответы
- За счет чего конфигурация лучше загружает GPU?
MPS дает четырем процессам общий контекст GPU и запускает их ядра параллельно без изменения кода. Каждому экземпляру выделяется по 25% потоковых мультипроцессоров вместо последовательного доступа к GPU.
- Как меняются производительность и задержка на одном GPU?
Пропускная способность растет с примерно 62 до 92,1 запроса в секунду, при этом задержка остается менее секунды. В стандартной конфигурации средняя задержка была менее 650 мс, а p99 менее 1 000 мс.
- Для какой нагрузки проверяли эту схему?
Конфигурацию показали на NVIDIA Parakeet TDT 0.6B V2 для ASR-сервиса Heidi Health, который обрабатывает более 2,4 млн клинических консультаций в неделю в 190 странах.
Контекст по теме
- Amazon Bedrock в AWS GovCloud (US) получил модели OpenAI GPT OSS и NVIDIA Nemotron1 июля 2026 г.
- NVIDIA заявила о снижении стоимости токенов на Blackwell за счет inference-стека30 июня 2026 г.
- Как использовать NVIDIA Canary-1B-v2 для распознавания речи, перевода и экспорта субтитров SRT в Python23 июня 2026 г.
- NVIDIA: сложности распознавания клинической терминологии в речевых ИИ и оценка моделей ASR10 июня 2026 г.