К содержанию
Новости

Переход на multi-agent-архитектуру незаметно утроил расходы на токены

Абстрактная графика hegai.media: плотное поле мелких квадратов разной яркости с приводочной меткой
Графика: hegai.media

Команда одного из LLM-приложений заметила резкий рост потребления токенов после того, как часть пайплайна перевели с single-agent на multi-agent-архитектуру. При этом уровень трафика не изменился. Как пишет Towards Data Science, для координации агентов использовали LangGraph, а supervisor node распределял дальнейшие шаги обработки.

Сначала разработчики рассчитывали только на умеренный рост затрат из-за большего числа вызовов моделей. На практике расходы выросли примерно втрое, даже для задач, которые по сути остались прежними. Анализ логов показал, что дело не в избыточном fan-out: supervisor вызывал подагентов примерно так, как и ожидалось.

Главная причина лишних затрат оказалась связана с повторными вызовами. Ошибки валидации, например malformed tool call, schema mismatch или ответы модели обычным текстом вместо вызова инструмента, запускали агента заново. Система при этом повторно восстанавливала upstream context, а в некоторых сценариях снова вызывала подагентов, уже завершивших работу. Из-за этого даже единичный сбой внутри графа мог привести к каскаду повторных вычислений и дополнительному расходу токенов.

Ключевые факты

  • Рост потребления токенов произошёл при неизменном уровне трафика.

  • Архитектура использовала LangGraph и supervisor node для координации агентов.

  • Повторные вызовы запускались из-за ошибок валидации, включая malformed tool call и schema mismatch.

  • В отдельных сценариях retry одного агента приводил к повторному запуску уже выполненных подагентов ради восстановления контекста.

Вопросы и ответы

Почему расходы выросли почти втрое, хотя трафик не изменился?

Рост дал не fan-out между агентами, а механизм retry. Ошибки валидации вроде malformed tool call, schema mismatch или ответа текстом вместо tool call запускали повторные вызовы и восстановление upstream context, что резко увеличивало расход токенов.

Что именно в multi-agent-схеме усиливало перерасход токенов?

Архитектура на LangGraph с supervisor node могла повторно запускать уже отработавших подагентов. В отдельных сценариях retry одного агента инициировал повторные вычисления по цепочке ради восстановления контекста.

Чем проблема отличалась от ожидаемого роста затрат после перехода на multi-agent?

Команда закладывала умеренное увеличение расходов из-за большего числа model calls, но фактический перерасход оказался связан с каскадными retry. Даже задачи без изменений по функциональности стали потреблять примерно втрое больше токенов.

Контекст по теме