Переход на multi-agent-архитектуру незаметно утроил расходы на токены

Команда одного из LLM-приложений заметила резкий рост потребления токенов после того, как часть пайплайна перевели с single-agent на multi-agent-архитектуру. При этом уровень трафика не изменился. Как пишет Towards Data Science, для координации агентов использовали LangGraph, а supervisor node распределял дальнейшие шаги обработки.
Сначала разработчики рассчитывали только на умеренный рост затрат из-за большего числа вызовов моделей. На практике расходы выросли примерно втрое, даже для задач, которые по сути остались прежними. Анализ логов показал, что дело не в избыточном fan-out: supervisor вызывал подагентов примерно так, как и ожидалось.
Главная причина лишних затрат оказалась связана с повторными вызовами. Ошибки валидации, например malformed tool call, schema mismatch или ответы модели обычным текстом вместо вызова инструмента, запускали агента заново. Система при этом повторно восстанавливала upstream context, а в некоторых сценариях снова вызывала подагентов, уже завершивших работу. Из-за этого даже единичный сбой внутри графа мог привести к каскаду повторных вычислений и дополнительному расходу токенов.
Ключевые факты
Рост потребления токенов произошёл при неизменном уровне трафика.
Архитектура использовала LangGraph и supervisor node для координации агентов.
Повторные вызовы запускались из-за ошибок валидации, включая malformed tool call и schema mismatch.
В отдельных сценариях retry одного агента приводил к повторному запуску уже выполненных подагентов ради восстановления контекста.
Вопросы и ответы
- Почему расходы выросли почти втрое, хотя трафик не изменился?
Рост дал не fan-out между агентами, а механизм retry. Ошибки валидации вроде malformed tool call, schema mismatch или ответа текстом вместо tool call запускали повторные вызовы и восстановление upstream context, что резко увеличивало расход токенов.
- Что именно в multi-agent-схеме усиливало перерасход токенов?
Архитектура на LangGraph с supervisor node могла повторно запускать уже отработавших подагентов. В отдельных сценариях retry одного агента инициировал повторные вычисления по цепочке ради восстановления контекста.
- Чем проблема отличалась от ожидаемого роста затрат после перехода на multi-agent?
Команда закладывала умеренное увеличение расходов из-за большего числа model calls, но фактический перерасход оказался связан с каскадными retry. Даже задачи без изменений по функциональности стали потреблять примерно втрое больше токенов.
Контекст по теме
- Planck описала, почему рост числа LLM-агентов увеличил задержки в системе23 июля 2026 г.
- Почему расчёт токенов перестал быть универсальной метрикой для AI-моделей17 июля 2026 г.
- Как мультиагентная архитектура помогает резко снизить расходы на LLM26 июня 2026 г.
- Компании ищут способы снизить расходы на AI из‑за стремительного роста потребления токенов18 июня 2026 г.