Один запрос к AI-агенту нельзя считать одной операцией. В журнале использования Claude Code он в среднем превращался в двенадцать вызовов модели и обработку 2,9 млн токенов, а расчетное энергопотребление оказалось примерно в 600 раз выше, чем у обычного текстового запроса.
Это не универсальный коэффициент для всех агентов. Но это достаточно сильный сигнал для фаундера: экономика продукта начинается не с цены токена или сообщения, а со стоимости полностью завершённой задачи.
Что именно посчитали
Как пишет The Decoder, климатолог Зик Хаусфатер восемь недель собирал локальные логи своей работы с Claude Code. Его 1 138 введённых запросов запустили более 14 тысяч вызовов модели и обработку 3,2 млрд токенов.
Главный сюрприз находится не в ответах, которые видел пользователь. На них пришлось только 0,4% всех обработанных токенов. Ещё 96% составили чтения кеша: на каждом следующем шаге агент заново просматривал накопленный контекст.
Хаусфатер оценил общее потребление в 170 кВт·ч с диапазоном неопределённости от 70 до 330 кВт·ч. Получилось около 150 Вт·ч на один введённый запрос. Для сравнения, Google оценивал медианный текстовый запрос к Gemini в 0,24 Вт·ч, а Сэм Альтман называл для среднего запроса ChatGPT 0,34 Вт·ч.
Отсюда и разница примерно в 600 раз. Но сравниваются здесь не два одинаковых действия. С одной стороны короткий чат, с другой цепочка, в которой агент планирует, вызывает модель снова и снова и носит за собой всё более тяжёлый контекст. Как формулирует Хаусфатер, считать AI по числу запросов примерно так же полезно, как измерять поездки без учёта расстояния.
Важно и ограничение методики. Напрямую в логах измерялись токены, а перевод в электричество сделан тремя способами с разными предположениями. Реальную энергоёмкость токена современных моделей вне AI-лабораторий никто не знает. Поэтому 600 раз стоит читать не как отраслевую константу, а как оценку конкретного интенсивного сценария.
Агент продаёт одну задачу, а покупает тысячи операций
Ранее исследование KAIST уже давало оценку, что AI-агенты могут потреблять в 136 раз больше энергии, чем обычный AI. Новый разбор ценен не очередным пугающим множителем, а детализацией механики: двенадцать вызовов на запрос, миллионы обработанных токенов и почти весь объём в невидимом пользователю перечитывании контекста.
Для бизнеса это означает неприятную асимметрию. Клиент покупает результат: исправленный код, подготовленный отчёт, обработанную заявку. Агент внутри может несколько раз зайти не туда, перечитать историю, вызвать инструменты и запустить параллельные ветки. В интерфейсе по-прежнему будет одна кнопка. В себестоимости уже живёт маленький вычислительный конвейер.
Поэтому тариф «за сообщение» способен создавать красивую, но ложную юнит-экономику. Даже если облачный прайс пока скрывает энергетическую нагрузку, она проявится в стоимости вызовов, ограничениях по объёму, скорости выполнения или потребности в доступной инфраструктуре. Особенно у продуктов, где агенты работают параллельно или получают задачи на дни и недели.
Практический вывод не в том, чтобы отказаться от агентов. Нужно сначала проверить, требуется ли задаче автономность. Если процесс можно описать ограниченным workflow с фиксированным числом шагов, такой вариант проще контролировать по стоимости и качеству. Агент оправдан там, где ценность его гибкости перекрывает цену длинной цепочки решений.
Что считать до масштабирования
Минимальная единица учёта теперь не prompt, а завершённый процесс. В продуктовой аналитике стоит видеть число вызовов модели на задачу, общий объём обработанных токенов, долю чтения кеша, повторные попытки, длину контекста и число параллельных агентов. Затем сравнивать полную стоимость выполнения с ценой, которую платит клиент.
Конкретный маркер на ближайшие месяцы: отношение обработанных токенов к видимому результату. Если агенты будут работать дольше, а доля перечитываемого контекста и число вызовов на задачу не начнут снижаться, автономность останется дорогой архитектурной роскошью. Тогда победят не самые «самостоятельные» продукты, а те, где агенту вовремя поставили ограждение.
