К содержанию
Новости

Wattage анализирует расход токенов в AI-агентах и может блокировать дорогие изменения в CI

Wattage анализирует расход токенов в AI-агентах и может блокировать дорогие изменения в CI

Разработчик Faizan Raza представил Wattage, инструмент для анализа затрат токенов в AI-агентах. Сервис работает с экспортом OTLP JSON trace: оценивает стоимость вызовов моделей в долларах, находит неэффективные паттерны и предлагает способы их исправления. Как пишет Hacker News, Wattage может работать полностью офлайн, без API-ключей и отдельной конфигурации.

В основе системы находится единая модель данных для сессий, задач, циклов и вызовов, построенная на OpenTelemetry GenAI semantic-convention traces. В инструменте есть восемь детекторов. Среди них повторная отправка стабильного префикса вместо кеширования, лишние tool-вызовы, чрезмерные reasoning-токены, retrieval_thrash и nonconvergence. Последние описывают сценарии, в которых агент зацикливается или меняет стратегии без прогресса.

Отдельно авторы выделяют механизм nonconvergence detection. Для проверки они собрали набор из 10 размеченных синтетических циклов и сравнили классификатор Wattage с baseline на основе точного SHA-256-сравнения. В демонстрационном trace симуляция исправления prefix_churn снизила стоимость на 44,7%: с $0.000199 до $0.000110. Такой результат получили за счет включения prompt caching для стабильного префикса.

Кроме этого, Wattage поддерживает генерацию HTML flame graph и может использоваться как CI-gate через badge и score-механизмы.

Ключевые факты

  • Wattage работает с OTLP JSON trace и поддерживает полностью офлайн-режим без API-ключей

  • Система использует восемь детекторов, включая prefix_churn, retrieval_thrash, model_mismatch и reasoning_overspend

  • Для проверки nonconvergence detector авторы использовали 10 размеченных синтетических циклов и сравнение с SHA-256 baseline

  • В демонстрационном trace исправление prefix_churn снизило стоимость на 44,7%, с $0.000199 до $0.000110

Вопросы и ответы

Можно ли внедрить Wattage без передачи данных внешнему сервису?

Да. Инструмент работает с OTLP JSON trace и поддерживает полностью офлайн-режим без API-ключей и отдельной конфигурации, поэтому его можно запускать внутри закрытого контура.

Что именно Wattage умеет находить в AI-агентах кроме общего подсчета стоимости?

Система использует восемь детекторов, включая prefix_churn, retrieval_thrash, model_mismatch, reasoning_overspend и nonconvergence. Они выявляют повторную отправку стабильного префикса вместо кеширования, лишние tool-вызовы, чрезмерные reasoning-токены и циклы без прогресса.

Есть ли пример, насколько реально снижаются расходы после исправлений?

В демонстрационном trace исправление проблемы prefix_churn через prompt caching снизило стоимость на 44,7%: с $0.000199 до $0.000110.

Контекст по теме