Wattage анализирует расход токенов в AI-агентах и может блокировать дорогие изменения в CI
Разработчик Faizan Raza представил Wattage, инструмент для анализа затрат токенов в AI-агентах. Сервис работает с экспортом OTLP JSON trace: оценивает стоимость вызовов моделей в долларах, находит неэффективные паттерны и предлагает способы их исправления. Как пишет Hacker News, Wattage может работать полностью офлайн, без API-ключей и отдельной конфигурации.
В основе системы находится единая модель данных для сессий, задач, циклов и вызовов, построенная на OpenTelemetry GenAI semantic-convention traces. В инструменте есть восемь детекторов. Среди них повторная отправка стабильного префикса вместо кеширования, лишние tool-вызовы, чрезмерные reasoning-токены, retrieval_thrash и nonconvergence. Последние описывают сценарии, в которых агент зацикливается или меняет стратегии без прогресса.
Отдельно авторы выделяют механизм nonconvergence detection. Для проверки они собрали набор из 10 размеченных синтетических циклов и сравнили классификатор Wattage с baseline на основе точного SHA-256-сравнения. В демонстрационном trace симуляция исправления prefix_churn снизила стоимость на 44,7%: с $0.000199 до $0.000110. Такой результат получили за счет включения prompt caching для стабильного префикса.
Кроме этого, Wattage поддерживает генерацию HTML flame graph и может использоваться как CI-gate через badge и score-механизмы.
Ключевые факты
Wattage работает с OTLP JSON trace и поддерживает полностью офлайн-режим без API-ключей
Система использует восемь детекторов, включая prefix_churn, retrieval_thrash, model_mismatch и reasoning_overspend
Для проверки nonconvergence detector авторы использовали 10 размеченных синтетических циклов и сравнение с SHA-256 baseline
В демонстрационном trace исправление prefix_churn снизило стоимость на 44,7%, с $0.000199 до $0.000110
Вопросы и ответы
- Можно ли внедрить Wattage без передачи данных внешнему сервису?
Да. Инструмент работает с OTLP JSON trace и поддерживает полностью офлайн-режим без API-ключей и отдельной конфигурации, поэтому его можно запускать внутри закрытого контура.
- Что именно Wattage умеет находить в AI-агентах кроме общего подсчета стоимости?
Система использует восемь детекторов, включая prefix_churn, retrieval_thrash, model_mismatch, reasoning_overspend и nonconvergence. Они выявляют повторную отправку стабильного префикса вместо кеширования, лишние tool-вызовы, чрезмерные reasoning-токены и циклы без прогресса.
- Есть ли пример, насколько реально снижаются расходы после исправлений?
В демонстрационном trace исправление проблемы prefix_churn через prompt caching снизило стоимость на 44,7%: с $0.000199 до $0.000110.
Контекст по теме
- Почему расчёт токенов перестал быть универсальной метрикой для AI-моделей17 июля 2026 г.
- В публикации The Engineer заявили, что AI-агенты уступают обычному ИИ по эффективности в 136,5 раза13 июля 2026 г.
- RFC предлагает ограничивать расходы AI-агентов через резервирование бюджета на уровне сессии4 июля 2026 г.
- В MIT разработали быстрый способ оценки энергопотребления AI-нагрузок9 июня 2026 г.