Долгоживущие двунаправленные потоки real-time AI-агентов требуют иного подхода к распределению нагрузки, чем обычные веб-запросы. Как пишет Google Developers Blog, показатели QPS и текущей загрузки CPU не показывают весь объём обязательств сервера. Соединение может оставаться открытым, а внутри него продолжают передаваться аудиофрагменты, расшифровки, ответы модели и синтезированная речь.
Разработчикам предлагают отслеживать активные сессии на уровне приложения: от начала потокового взаимодействия до его завершения, сбоя или отмены. При закрытии сессии счётчик должен корректно уменьшаться. Если этого не сделать, система увидит несуществующую перегрузку. Повторное уменьшение, наоборот, создаст ложный запас мощности и привлечёт избыточный трафик.
Число активных сессий стоит учитывать вместе с загрузкой CPU в гибридном алгоритме маршрутизации. Первый показатель отражает обязательства по обслуживанию разговоров, которые сервер уже принял, второй показывает текущую вычислительную нагрузку. Такой подход учитывает и периоды молчания пользователей, и резкие всплески обработки, когда несколько участников начинают говорить одновременно.
Ключевые факты
В примере 100 запросов по 50 миллисекунд создают менее длительную нагрузку, чем 5 сессий по 20 минут.
20 молчащих сессий могут выглядеть как низкая загрузка, но одновременная речь пользователей способна вызвать резкий рост использования CPU.
Для двунаправленной потоковой передачи real-time агенты могут использовать gRPC или WebSockets.
В памяти среды выполнения одной сессии могут находиться аудиобуферы, частичные расшифровки, активные вызовы инструментов, контекст модели и пользовательские метрики.
Вопросы и ответы
- Почему стандартных метрик QPS и загрузки CPU недостаточно?
100 запросов по 50 миллисекунд создают меньшие обязательства, чем 5 сессий по 20 минут. Кроме того, 20 молчащих сессий могут почти не нагружать CPU, но одновременная речь пользователей вызовет резкий скачок вычислений.
- Какую метрику нужно добавить и как её считать?
Нужно считать активные сессии на уровне приложения: увеличивать счётчик при начале потокового взаимодействия и уменьшать при завершении, сбое или отмене. Пропущенное уменьшение создаст ложную перегрузку, а повторное уменьшение привлечёт на сервер избыточный трафик.
- Что именно удерживает ресурсы сервера во время такой сессии?
Одна сессия через gRPC или WebSockets может хранить в памяти аудиобуферы, частичные расшифровки, активные вызовы инструментов, контекст модели и пользовательские метрики.
Контекст по теме
- Google Cloud: 83% компаний считают необходимым обновление инфраструктуры для agentic AI7 июля 2026 г.
- Как выбор инфраструктуры влияет на запуск AI-агентов в продакшене30 июня 2026 г.
- Ampersend построила слой pay‑per‑intelligence для AI‑агентов на базе Amazon Bedrock AgentCore Payments22 июня 2026 г.
- Исследование: масштаб системы становится главным ограничением для оркестрации мультиагентного Enterprise AI19 июня 2026 г.
