К содержанию
Выпуск №72 · 19 августа 2026 / Новости

Подключаемым skills нужен токен-бюджет: Claude Code сжигал 200 тысяч токенов до ответа

Стоимость агента нельзя считать по видимому диалогу. Один встроенный skill Claude Code загружал сотни страниц контекста заранее, поэтому лимиты и логи нужны не только модели, но и каждому расширению.

Редакция 19 августа 2026 г., 23:18 MSK

В Telegram

Claude Code мог потратить около 200 тысяч токенов ещё до ответа на однострочный вопрос. Это не курьёз с неудачным промптом, а отдельный класс расходов: подключаемый skill способен заполнить контекст до того, как агент приступит к полезной работе.

Для билдера вывод неприятный, но практичный. Если вы видите только запрос пользователя и ответ модели, вы не видите реальную себестоимость агента.

Что съело контекст

Как пишет The New Stack, встроенный skill /claude-api, который помогает разработчикам работать с Claude API и Managed Agents, загружал больше 200 тысяч токенов. В Claude Code v2.1.234 Anthropic сократила стартовый объём примерно до 25 тысяч токенов, то есть как минимум на 85,7%.

Проблема была в устройстве загрузки. Skill встраивал справочные материалы и документацию по обнаруженному языку прямо в своё тело. В GitHub-issue от 7 июля разработчик насчитал около 120 тысяч токенов только в справочных файлах одного вызова. Один документ по миграции занимал примерно 36 тысяч токенов. После загрузки остальных материалов даже короткий вопрос раздувался примерно до 200 тысяч токенов ещё до начала ответа.

Skill при этом не обязательно запускать вручную. Claude Code мог активировать /claude-api, если проект импортировал Python- или TypeScript-SDK Anthropic. То есть расход возникал как следствие окружения проекта, а не явного решения пользователя заказать модели большую порцию документации.

Второй баг-репорт от 4 августа показал ещё более показательный сценарий. Если skill не определял язык проекта во время аудита промпта, он загружал документацию для C#, cURL, Go, Java, PHP, Python, Ruby и TypeScript, а также 26 общих Markdown-файлов. Весь каталог занимал 812 650 байт, хотя для воспроизведённой задачи сразу требовался только один файл размером 32 954 байта.

Большая библиотека сама по себе полезна. Но загрузить всю библиотеку перед одним вопросом примерно то же самое, что перед звонком клиенту заставить менеджера перечитать корпоративный архив. Информация может пригодиться. Счёт за подготовку придёт гарантированно.

Почему обычный контроль расходов этого не замечает

Документация Claude Code говорит, что тело skill остаётся в контексте между ходами. Разработчик при этом может видеть лишь небольшой запрос и такой же небольшой ответ. Получается фиксированный скрытый расход, который наследует каждый следующий шаг задачи.

Есть и вторая цена. В руководстве Anthropic по Claude Code сказано, что по мере заполнения контекстного окна качество ухудшается: модель чаще теряет ранние инструкции и ошибается. Значит, лишняя документация конкурирует не только с бюджетом, но и с кодом репозитория, историей задачи и правилами проекта. Экономия здесь не бухгалтерская косметика. Она освобождает рабочую память агента.

Исправление Anthropic следует архитектуре, которую компания описывает для skills: постоянно держать только небольшой объём метаданных, при срабатывании загружать основные инструкции из SKILL.md, а спецификации, примеры и прочие ресурсы открывать по мере необходимости. Claude может сделать дополнительное чтение файла, зато не платит контекстом за материалы, не связанные с задачей.

Какой предохранитель нужен билдеру

Я бы не выпускал skill в рабочий контур без четырёх метрик: сколько токенов было в контексте до его активации, сколько добавило тело skill, какие вспомогательные файлы он открыл и с каким объёмом контекста начался первый полезный ответ. Итоговую цифру нужно писать в лог отдельно от пользовательского диалога. Иначе оптимизировать будут промпт, который виден, пока бюджет съедает справочник, которого никто не видел.

Второй обязательный слой состоит из лимитов. У каждого skill должен быть стартовый токен-бюджет, ленивое подключение подробных инструкций и аварийное завершение при превышении порога. Порог зависит от задачи, но его отсутствие уже само по себе архитектурное решение: любой пакет документации получает право занять столько контекста, сколько сумеет.

Следить теперь стоит не за средней длиной ответа, а за отношением скрытого стартового контекста к контексту самой задачи. Если после внедрения skills эта доля растёт, а в логах нельзя назвать конкретные загруженные файлы, предохранителей у агента всё ещё нет. Следующий счёт лишь сообщит об этом менее деликатно.

Как процитировать

«Подключаемым skills нужен токен-бюджет: Claude Code сжигал 200 тысяч токенов до ответа». hegai.media, 19 августа 2026 г.. https://hegai.media/novosti/podklyuchaemym-skills-nuzhen-token-byudzhet-claude-code-szhigal-200-ty--5c15614a-6d05-486a-a874-46e109e99715

так материал выглядит в мессенджере