Как сообщает The New Stack со ссылкой на отчёт Akamai State of AI Inference 2026, половина корпоративных ИИ-внедрений не укладывается в собственные целевые показатели задержки при пиковой нагрузке. Опрос 200 специалистов показал: для критически важных сценариев 82% организаций требуется сквозное время ответа не более 500 миллисекунд, а 64% рассчитывают на задержку менее 250 миллисекунд.
В агентных системах один пользовательский запрос может запустить десятки последовательных операций. Модель рассуждает, вызывает инструменты, обращается к API и получает контекст. Если агент работает на LangChain, CrewAI или Pydantic AI, каждый переход через глобальную сеть к централизованному дата-центру добавляет задержку. Цепочка из 50 таких переходов способна увеличить сетевое ожидание до нескольких секунд, независимо от скорости генерации токенов. В работе, опубликованной на arXiv в ноябре 2025 года, исследователи подсчитали, что обработка на стороне CPU может составлять до 90,6% общей задержки агентных нагрузок.
Распространённые тесты производительности LLM обычно измеряют количество токенов в секунду и загрузку GPU на одном сервере. Поведение всей агентной цепочки они при этом не показывают. По данным опроса LangChain State of Agent Engineering 2026, в котором участвовали более 1 300 специалистов, агенты уже работают в продакшене у 57,3% организаций. Годом ранее этот показатель составлял 51%.
Ключевые факты
В исследовании Akamai участвовали 200 специалистов по ИИ.
Для критически важных сценариев 82% организаций требуют время ответа не более 500 миллисекунд, а 64%, менее 250 миллисекунд.
Обработка на стороне CPU может составлять до 90,6% общей задержки в агентных нагрузках.
Агенты работают в продакшене у 57,3% организаций против 51% годом ранее.
Вопросы и ответы
- Какая задержка приемлема для критически важных ИИ-сценариев?
82% организаций требуют сквозное время ответа не более 500 миллисекунд, а 64% ставят более жёсткий порог, менее 250 миллисекунд.
- Где искать узкое место, если ускорение GPU не помогает?
В агентных нагрузках до 90,6% общей задержки может приходиться на обработку на стороне CPU. Кроме того, цепочка из 50 сетевых переходов к централизованному дата-центру способна добавить секунды ожидания независимо от скорости генерации токенов.
- Насколько агентные системы уже распространены в продакшене?
Они работают в продакшене у 57,3% организаций против 51% годом ранее, по опросу более 1 300 специалистов.
Контекст по теме
- Исследования показывают разрыв между бюджетами на ИИ и их внедрением в продакшен28 июля 2026 г.
- Intel описала требования к инфраструктуре для agentic AI в корпоративной среде27 июля 2026 г.
- Google Cloud: 83% компаний считают необходимым обновление инфраструктуры для agentic AI7 июля 2026 г.
- Почему CPU остаётся ключевым элементом инфраструктуры agentic AI27 июня 2026 г.